Kimi K3 de Moonshot AI: qué cambia frente a K2 y cuándo usarlo (2026)

Kimi K3 de Moonshot AI: qué cambia frente a K2 y cuándo usarlo (2026)

23 de julio del 20268 minKimi K3, Moonshot AI, IA, LLM, Open Source

Respuesta corta (60 segundos): Kimi K3 es el primer modelo open source de 2.8T parámetros (Moonshot AI, liberados el 27 de julio de 2026), con ventana de 1M tokens, visión nativa y arquitectura nueva (Kimi Delta Attention + Attention Residuals). Pricing API: USD 0.30/MTok input cache-hit, USD 3.00 cache-miss, USD 15.00 output. Brilla en: coding long-horizon, kernel optimization, agentic knowledge work y multimodal con video. Cuándo elegirlo: si necesitás 1M de contexto sin compaction, querés self-hosting post-release, o tenés workflows que se beneficien del cache-hit > 90% en coding. Cuándo no: si priorizás UX pulida y ecosistema maduro (ahora Claude Fable 5 y GPT-5.6 Sol ganan).

Kimi K3 es el lanzamiento más reciente de Moonshot AI y el primero de su línea que cruza el umbral de los 2T parámetros con pesos abiertos. Este post es la guía que wish hubiera tenido el día del anuncio: arquitectura, pricing, benchmarks honestos, y la pregunta real — ¿para qué trabajo es mejor que Claude Fable 5 o GPT-5.6 Sol, y para qué no?

La arquitectura: por qué importa KDA + AttnRes

Lo nuevo de K3 no es solo tamaño — son dos decisiones arquitectónicas que cambian cómo escala el modelo.

Kimi Delta Attention (KDA) es una variante de atención que mejora cómo la información fluye a través de secuencias largas. Combinado con Attention Residuals (AttnRes), que recupera representaciones selectivamente a través de las capas en vez de acumularlas uniformemente, Moonshot reporta una mejora de ~2.5× en scaling efficiency frente a K2: la misma cantidad de cómputo produce más inteligencia medida en benchmarks.

K3 también escala sparsity del Mixture-of-Experts: usa Stable LatentMoE con 16 de 896 expertos activos por token. El routing es el primer desafío a esta escala — por eso Moonshot introduce Quantile Balancing (deriva la asignación de expertos de los quantiles del router-score, eliminando el hiperparámetro sensible de balancing) y Per-Head Muon (optimiza heads de atención independientemente para learning más adaptativo a escala).

Otros componentes relevantes: SiTU (Sigmoid Tanh Unit) para control de activación, Gated MLA para selectividad de atención, y MXFP4 weights + MXFP8 activations desde SFT para compatibilidad broad de hardware.

Todo esto suena a buzzwords hasta que ves los números: en coding long-horizon, Moonshot reporta que K3 maneja sesiones de ingeniería extensas con mínima supervisión, navega repos grandes y orquesta terminal tools de forma estable. En el post oficial cuentan cómo un early build de K3 manejó la mayoría del trabajo de kernel optimization del equipo en las etapas tardías del desarrollo.

Specs y pricing

SpecValor
Parámetros totales2.8T
Expertos activos16 de 896 (MoE)
Context window1M tokens
ModalidadTexto + visión nativa + video
Reasoning effort defaultmax (low y high próximos)
Pesos abiertos27 de julio de 2026

Pricing oficial de la API:

TipoUSD / 1M tokens
Input (cache hit)0.30
Input (cache miss)3.00
Output15.00

Para coding workloads, Moonshot reporta cache hit rate arriba del 90% — en práctica, si tu workflow tiene prefixes repetidos (system prompt, contexto común), pagás input al precio de cache-hit la mayoría del tiempo.

Benchmarks: dónde K3 es frontier y dónde todavía no

Moonshot compara K3 contra Claude Fable 5, Claude Opus 4.8, GPT-5.6 Sol, GPT-5.5 y GLM-5.2. La lectura honesta:

K3 es competitivo o gana en:

  • Coding long-horizon (DeepSWE, Terminal-Bench 2.1, SWE Marathon, FrontierSWE)
  • Kernel optimization (H200 y GPGPU alternate vendor)
  • Agentic knowledge work (OfficeQA Pro, SpreadsheetBench 2, MCP Atlas, AutomationBench)
  • Multimodal con video (edición frame-accurate, motion graphics)
  • Razonamiento sobre repos grandes con código y visuales mezclados

K3 todavía no alcanza a Claude Fable 5 ni GPT-5.6 Sol en:

  • User experience pulida (Moonshot es explícito sobre esta brecha)
  • Ecosistema de tooling third-party maduro
  • Latencia consistente en producción a escala masiva (los pesos de 2.8T pesan en inference)

En coding, el ranking actual según los benchmarks publicados posiciona a K3 detrás de Fable 5 pero por delante de Opus 4.8 en tareas con agente. En OfficeQA Pro, SpreadsheetBench 2 y GDPval-AA, los tres top están muy cerca y la elección depende más del ecosistema que del benchmark puro.

Casos donde K3 brilla con casos reales

El blog de Moonshot muestra casos públicos, no benchmarks aislados. Tres que vale la pena entender:

1. MiniTriton — un compilador GPU desde cero. K3 desarrolló un compilador estilo Triton con su propio IR tile-level sobre MLIR, optimization passes y pipeline de PTX codegen. El output alcanza performance comparable a Triton y torch.compile, y entrena nanoGPT end-to-end con convergencia estable. Es la diferencia entre "optimizar kernels aislados" y "construir un compilador coherente" — el segundo enfoque requiere agenticidad de muchas horas.

2. Diseño de chip en 48 horas. Como proof of concept, K3 diseñó, optimizó y verificó un chip para servir un nano model construido sobre su propia arquitectura, usando open-source EDA tools sobre Nangate 45nm. Cerró timing a 100 MHz en menos de 4 mm², con 8,700 tokens/s de decode throughput en simulación.

3. Investigación astrofísica reproducible. Para reproducir las universal relations I-Love-Q, K3 revisó 20+ papers, implementó el pipeline numérico, evaluó 300+ ecuaciones de estado, identificó inconsistencias en fórmulas publicadas, generó 3,000+ líneas de Python y produjo un dashboard HTML interactivo. Lo que toma 1-2 semanas a un investigador experimentado, K3 lo hizo en 2 horas.

Estos casos son cherry-picked por Moonshot, sí — pero son del tipo de tareas donde un founder con un SaaS no va a gastar USD 50K de consultoría para automatizar. K3 cambia el cálculo económico.

Cómo acceder a Kimi K3

Cuatro caminos oficiales:

  • Kimi.com — chat web y mobile (iOS, Android, HarmonyOS)
  • Kimi Work desktop app — versión 3.1.0+ para Windows y Apple silicon Mac; ideal para knowledge work agentic
  • Kimi Code — CLI para terminal con comando /model kimi-k3
  • Kimi API Platformkimi-k3 como model ID; pricing como en la tabla de arriba
  • Kimi Enterprise — data privacy separada, member management para equipos

Si vas por self-hosting: esperá al 27 de julio. Moonshot contribuye la implementación de KDA para prefix caching al proyecto vLLM, así que vas a querer vLLM con ese patch para servir K3 a un precio de token competitivo.

Limitaciones que Moonshot admite explícitamente

Tres cosas que conviene tener en mente antes de elegir K3 sobre alternativas:

  1. Sensibilidad al thinking history. K3 fue entrenado en preserved thinking history mode. Si tu agent harness no pasa todo el contenido de thinking de vuelta, o si cambiás a K3 mid-session desde otro modelo, la calidad se vuelve muy inestable. Solución: usá un harness con compatibilidad verificada (Kimi Code) y evitá switching mid-session.

  2. Exceso de proactividad. El training de K3 enfatiza tareas long-horizon y desafiantes. Ante ambigüedad o issues menores, puede tomar decisiones inesperadas en nombre del usuario. Si tu aplicación necesita que el agente opere dentro de boundaries bien definidos, imponé constraints explícitas en el system prompt o en AGENTS.md.

  3. Brecha de UX. Moonshot es explícito: "a noticeable gap in user experience compared with Claude Fable 5 and GPT-5.6 Sol". La API funciona, pero la pulcritud del producto y la madurez del ecosistema third-party todavía no están al nivel de Anthropic u OpenAI.

Cuándo elegir K3 — y cuándo no

Elegí K3 si:

  • Necesitás 1M tokens de contexto sin compaction (BrowseComp score 90.4 con contexto completo)
  • Vas a hacer self-hosting post 27 de julio (costo total más bajo que API)
  • Tu workflow es coding long-horizon con prefix repetido (pagás cache-hit > 90% del tiempo)
  • Trabajás en research o agentic knowledge work donde la autonomía extendida paga
  • Querés visión nativa integrada con texto y video en el mismo modelo

Elegí Claude Fable 5 o GPT-5.6 Sol si:

  • Priorizás pulcritud de UX y ecosistema maduro de tools/integraciones
  • Hacés coding corto con tool calling estándar (la mayoría de SaaS CRUD con AI)
  • Necesitás compliance maduro (HIPAA, SOC2, etc.) — los proveedores top tienen años de ventaja
  • Tu workload es sensible a latencia consistente

Elegí K2 todavía si:

  • Ya tenés K2 en producción y el upgrade no es urgente
  • Tu inference hardware no llega a los 64+ accelerators que Moonshot recomienda para K3

¿Querés discutir cómo encaja Kimi K3 en tu stack antes de gastar USD 50K de implementación? Hay un CTA al final con una llamada gratis de 30 minutos.

Preguntas frecuentes

¿Qué es Kimi K3 en una frase?

Es el modelo más reciente de Moonshot AI: 2.8T parámetros con arquitectura Kimi Delta Attention + Attention Residuals, ventana de 1M tokens, visión nativa y razonamiento multimodal. Es el primer modelo open source que cruza el umbral de los 2T parámetros y compite con modelos propietarios en coding long-horizon y knowledge work.

¿Cómo se compara con Kimi K2?

K3 es ~2.5× más eficiente en scaling que K2 (la misma cantidad de cómputo produce más inteligencia medida en benchmarks), soporta contexto 1M (vs ~200K de K2), y tiene visión nativa (K2 era principalmente texto). K3 usa Mixture-of-Experts con 16 de 896 expertos activados por token (Stable LatentMoE).

¿Kimi K3 es gratis?

Los pesos completos se liberan el 27 de julio de 2026 (open source). Hasta entonces, podés usarlo via API de pago: USD 0.30/MTok cache-hit input, USD 3.00/MTok cache-miss input, USD 15.00/MTok output. Para coding workloads, Moonshot reporta cache hit rate arriba del 90%, lo que en práctica abarata mucho la factura.

¿En qué tareas brilla Kimi K3?

Coding long-horizon (sesiones de ingeniería de varias horas sin supervisión humana, navegación en repos grandes, orquestación de terminal), kernel optimization, agentic knowledge work, investigación con visualización interactiva, y multimodal con video (edición de video con sincronización frame-accurate). En el blog oficial muestran casos donde K3 diseñó un chip en 48 horas o compiló 3000 líneas de código de investigación astrofísica en 2 horas.

¿Cuándo conviene Kimi K3 sobre Claude Fable 5 o GPT-5.6 Sol?

Para tareas que requieren 1M tokens de contexto sin compaction, o cuando querés self-hosting (los pesos se liberan el 27 de julio). Para tareas de coding corto con tool calling maduro, Claude y GPT siguen adelante en user experience y ecosistema. Moonshot es explícito: K3 tiene una brecha notable de UX frente a los modelos propietarios top.

¿Kimi K3 está disponible en español?

Sí, vía API y en kimi.com. El modelo fue entrenado con datos multilingües (el benchmark interno mide performance en chino, inglés y otros idiomas). En benchmarks específicos de español no tengo data pública al cierre de este post — voy a actualizar con números cuando Moonshot publique la versión del technical report completa.