Moonshot AI anunció Kimi K3 el 16 de julio de 2026, pero la noticia que realmente cambia el tablero llegó el 27 de julio: la compañía liberó los pesos completos del modelo en GitHub y Hugging Face. Kimi K3 entra así en una categoría que hasta ahora parecía reservada a los laboratorios con modelos cerrados: inteligencia de frontera, capacidades agénticas, comprensión visual y una ventana de contexto de un millón de tokens, pero con los parámetros disponibles para que terceros puedan estudiar, desplegar y modificar el sistema.
La cifra que encabeza la presentación impresiona: 2,8 billones de parámetros —2.8 trillion en la nomenclatura anglosajona—. Sin embargo, el verdadero interés de Kimi K3 no reside únicamente en su tamaño. Su arquitectura Mixture-of-Experts, el nuevo mecanismo Kimi Delta Attention, las conexiones Attention Residuals y la cuantificación nativa en MXFP4 muestran hacia dónde se dirige la ingeniería de los modelos de gran escala: sistemas enormes, pero muy dispersos, capaces de seleccionar solo una pequeña parte de su capacidad para procesar cada token.
La clave de la noticia: Kimi K3 no es solo un modelo que puede utilizarse mediante una API. Sus pesos se pueden descargar, inspeccionar, alojar y adaptar, dentro de los límites de su licencia.
Qué significa realmente que Kimi K3 sea open weight
Conviene empezar por una precisión terminológica. Moonshot AI utiliza en algunos materiales la expresión «open source», pero la denominación más rigurosa es open weight o modelo de pesos abiertos. La compañía publica los pesos, la configuración, documentación técnica y soporte para motores de inferencia, pero no proporciona todos los elementos necesarios para reproducir el modelo desde cero, como el conjunto completo de datos y el proceso íntegro de entrenamiento.
La diferencia no es un simple debate semántico. Un modelo open weight permite realizar acciones imposibles con una API cerrada:
- Despliegue en infraestructura propia: los datos pueden permanecer dentro de la organización.
- Auditoría e investigación: es posible estudiar activaciones, parámetros, sesgos y comportamiento interno.
- Fine-tuning y especialización: se pueden crear derivados adaptados a dominios concretos.
- Independencia del proveedor: el acceso no depende exclusivamente de que Moonshot mantenga una API o unas condiciones comerciales determinadas.
- Optimización comunitaria: proyectos como vLLM, SGLang o TokenSpeed pueden desarrollar kernels, formatos y estrategias de inferencia específicos.
Ahora bien, que los pesos estén disponibles no significa que el modelo sea fácil de ejecutar. La apertura elimina una barrera jurídica y técnica, pero no la enorme barrera computacional.
Una arquitectura gigantesca, pero dispersa
Kimi K3 utiliza una arquitectura Mixture-of-Experts (MoE). En lugar de hacer pasar cada token por todos los parámetros, un mecanismo de enrutamiento selecciona los expertos más adecuados. El modelo dispone de 896 expertos y activa 16 por token, además de dos expertos compartidos. Por eso tiene 2,8 billones de parámetros totales, pero utiliza aproximadamente 104.000 millones en cada paso de inferencia.
| Característica | Kimi K3 |
|---|---|
| Arquitectura | Mixture-of-Experts |
| Parámetros totales | 2,8 billones |
| Parámetros activados | 104.000 millones por token |
| Capas | 93 |
| Expertos | 896, con 16 seleccionados por token y 2 compartidos |
| Contexto máximo | 1.048.576 tokens |
| Atención | 69 capas KDA y 24 capas Gated MLA |
| Visión | MoonViT-V2, con 401 millones de parámetros |
| Cuantificación | Pesos MXFP4 y activaciones MXFP8 |
El enfoque MoE reduce el trabajo aritmético respecto a un modelo denso de tamaño equivalente, pero no hace desaparecer los parámetros inactivos. Todos los expertos deben estar almacenados y disponibles para cuando el enrutador los seleccione. Esta es una distinción importante: 104.000 millones de parámetros activos no equivalen a necesitar memoria únicamente para 104.000 millones.
Tip técnico — calcula antes de descargar: con 2,8 billones de parámetros almacenados a 4 bits, el límite teórico de los pesos ronda 1,4 TB, sin contar estados de ejecución, cachés, buffers ni sobrecarga del motor. No es un modelo para una GPU doméstica. Para experimentar, la API es la vía razonable; el autoalojamiento está pensado para infraestructura distribuida con aceleradores y conexiones de gran ancho de banda.
KDA y Attention Residuals: las dos novedades fundamentales
El contexto de un millón de tokens sería extremadamente caro si todas las capas emplearan atención completa convencional. Kimi K3 combina 69 capas de Kimi Delta Attention (KDA) con 24 capas Gated MLA. KDA funciona como un mecanismo recurrente de atención lineal: en lugar de conservar un par de claves y valores para cada token anterior, mantiene y actualiza un estado interno. Las capas de atención completa aparecen periódicamente para conservar capacidades que los mecanismos lineales pueden perder.
Esta arquitectura híbrida reduce la presión de memoria del contexto largo, aunque traslada parte de la complejidad al motor de inferencia. vLLM ha tenido que adaptar su sistema de prefix caching para coordinar dos memorias diferentes: el estado recurrente de KDA y la caché KV de las capas de atención completa.
La segunda innovación es Attention Residuals (AttnRes). En un Transformer tradicional, la información se acumula a través de un único flujo residual que atraviesa todas las capas. AttnRes permite recuperar y combinar representaciones generadas por bloques anteriores. La idea pretende mejorar el flujo de información en redes muy profundas, aunque también introduce más lecturas, escrituras y tráfico entre dispositivos durante la inferencia.
Moonshot afirma que la combinación de KDA, AttnRes y Stable LatentMoE proporciona una eficiencia de escalado aproximadamente 2,5 veces superior a Kimi K2. Es una cifra del fabricante y deberá ser contrastada a medida que la comunidad evalúe el modelo y sus costes reales de despliegue.
Multimodalidad y un millón de tokens de contexto
Kimi K3 integra de forma nativa texto e imágenes mediante el encoder MoonViT-V2. La documentación comercial también muestra flujos con vídeo, que se carga a través de la API para su procesamiento. El objetivo no es limitarse a describir una imagen: Moonshot posiciona el modelo para tareas agénticas donde la percepción visual forma parte del ciclo de trabajo, como revisar capturas de una interfaz, corregir un frontend, analizar documentos, trabajar con CAD o interpretar el resultado visual de una aplicación.
Su ventana de 1.048.576 tokens permite introducir repositorios grandes, documentación técnica extensa o bases de conocimiento completas. Pero disponer de un millón de tokens no significa que debamos llenar siempre el contexto. Cuanto mayor sea la entrada, mayores serán la latencia, el consumo y la dificultad para que el modelo localice la información relevante.
Tip técnico — aprovecha la caché de contexto: la API realiza prefix caching automáticamente cuando el prefijo anterior supera los 256 tokens. Mantén sin cambios la parte extensa y reutilizable —por ejemplo, documentación o normas del proyecto— y añade al final cada nueva pregunta. Modificar el principio del prompt puede impedir que la siguiente petición reutilice la caché.
Qué dicen los benchmarks
Los resultados publicados sitúan a Kimi K3 en la franja de los modelos de frontera, aunque no domina todas las pruebas. Según la evaluación de Moonshot, obtiene un 93,5 en GPQA Diamond, un 88,3 en Terminal-Bench 2.1, un 91,2 en BrowseComp y un 94,5 en MCPMark-Verified. Destaca especialmente en tareas agénticas, uso de herramientas, búsqueda y programación prolongada.
Hay que interpretar estas comparaciones con prudencia. Los modelos no siempre se ejecutaron con el mismo arnés, algunos resultados proceden de fuentes externas y Kimi K3 se evaluó con reasoning_effort="max". Además, la liberación de los pesos es muy reciente. Las pruebas independientes, los costes de inferencia y la estabilidad en escenarios reales serán más informativos que una única tabla de puntuaciones.
Tip técnico — reproduce antes de concluir: al comparar modelos, registra el prompt, el arnés, las herramientas disponibles, el esfuerzo de razonamiento, los límites de tokens, el número de intentos y la métrica. Una diferencia de dos puntos puede deberse al modelo, pero también a una configuración distinta.
Cómo probar Kimi K3 mediante la API
Para la mayoría de desarrolladores, el primer contacto práctico será la API compatible con el SDK de OpenAI. Tras obtener una clave de Moonshot AI, la llamada básica en Python es sencilla:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="high",
messages=[
{
"role": "user",
"content": "Analiza este módulo y propón una refactorización segura."
}
],
)
print(response.choices[0].message.content)
Kimi K3 siempre mantiene activado el modo de razonamiento. El parámetro reasoning_effort acepta low, high y max; el valor predeterminado es max. Para una clasificación sencilla o una extracción estructurada, comenzar por low puede reducir latencia y consumo. Reserva max para problemas que realmente necesiten planificación profunda.
Tip técnico — conserva el mensaje completo: en conversaciones multiturno y ciclos con herramientas, devuelve en la siguiente petición el mensaje completo del asistente, incluidos
reasoning_contentytool_calls. Si guardas únicamentecontent, pierdes parte del estado que Kimi K3 espera conservar.
La API también admite salidas estructuradas con JSON Schema, selección obligatoria de herramientas y carga dinámica de definiciones. Para integraciones de producción, es preferible exigir un esquema estricto en lugar de pedir «devuélveme un JSON» mediante lenguaje natural.
Tip técnico — valida la salida: utiliza
response_formatconjson_schemaystrict: true. Procesa únicamente el campo finalmessage.content; no intentes extraer el JSON desdereasoning_content.
Autoalojamiento: abierto no significa ligero
Los pesos están disponibles en Hugging Face y Moonshot recomienda actualmente vLLM, SGLang y TokenSpeed como motores de inferencia. El soporte de vLLM incluye rutas específicas para KDA, Attention Residuals, MXFP4, multimodalidad y paralelismo de expertos, tanto en hardware NVIDIA como en una primera implementación para AMD.
Pero Kimi K3 no pertenece a la misma categoría práctica que los modelos cuantificados que se descargan para Ollama o LM Studio en un ordenador personal. Su escala exige distribuir los expertos entre muchos aceleradores y mantener comunicaciones rápidas entre ellos. La cuantificación reduce drásticamente la memoria, pero 2,8 billones de parámetros siguen siendo 2,8 billones de parámetros.
Esto produce una aparente paradoja: es uno de los modelos más abiertos de su nivel, pero muy pocas organizaciones pueden ejecutarlo completo por sí mismas. Su impacto se notará primero en proveedores de inferencia, universidades con infraestructura HPC, grandes empresas y proyectos comunitarios que desarrollen nuevas técnicas de compresión o despliegue.
Si quieres repasar las diferencias entre ejecutar modelos en infraestructura propia y consumirlos como servicio, puedes consultar también LLMs locales: revolucionando la IA desde casa. En el caso de Kimi K3, la filosofía es similar, pero la escala cambia por completo las reglas del juego.
Una licencia abierta, pero con condiciones
La licencia de Kimi K3 permite usar, copiar, modificar, publicar, distribuir, desplegar, hacer fine-tuning y crear obras derivadas. También autoriza el uso comercial, pero introduce condiciones que impiden equipararla sin matices a una licencia MIT convencional.
Si una empresa ofrece el modelo como servicio y supera 20 millones de dólares de ingresos agregados durante cualquier periodo consecutivo de doce meses, debe alcanzar un acuerdo separado con Moonshot antes de utilizar Kimi K3 comercialmente. Además, los productos o servicios que superen 100 millones de usuarios activos mensuales o 20 millones de dólares de ingresos mensuales deben mostrar de forma destacada el nombre «Kimi K3» en su interfaz. Estas restricciones no se aplican al uso interno ni al acceso mediante productos oficiales o socios certificados.
Tip técnico y legal: antes de incorporar un modelo open weight a un producto, versiona y archiva su licencia junto con el identificador exacto del checkpoint. «Los pesos están en Hugging Face» no sustituye una revisión de las obligaciones comerciales, de atribución y de cumplimiento.
Por qué esta liberación es una gran noticia
Kimi K3 demuestra que la distancia entre los modelos cerrados y los modelos de pesos abiertos continúa reduciéndose. No porque gane todas las métricas, sino porque reúne en un artefacto descargable capacidades que hasta hace poco parecían exclusivas: razonamiento prolongado, programación agéntica, uso de herramientas, visión y un contexto de un millón de tokens.
La liberación también permite que la comunidad estudie una arquitectura poco convencional a una escala inédita. KDA, AttnRes y un MoE con 896 expertos dejan de ser únicamente descripciones en un artículo técnico: ahora pueden inspeccionarse, optimizarse y convertirse en la base de trabajos derivados.
El movimiento no elimina los interrogantes. Faltan evaluaciones independientes, desplegar el modelo es extraordinariamente exigente y la licencia mantiene restricciones comerciales. Tampoco conocemos todos los datos utilizados para entrenarlo. Por eso, la expresión correcta sigue siendo open weight y no «completamente abierto».
Aun con esas reservas, el cambio es relevante. El acceso a modelos de frontera ya no depende únicamente de una caja negra ofrecida por API. Kimi K3 abre sus pesos y, con ellos, una nueva etapa de competencia: la batalla no será solo por construir el modelo más capaz, sino por conseguir que la comunidad pueda entenderlo, adaptarlo y ejecutarlo de forma eficiente.
Referencias
- Moonshot AI. Kimi K3: repositorio oficial.
- Moonshot AI. Pesos y ficha del modelo en Hugging Face.
- Moonshot AI. Informe técnico de Kimi K3.
- Moonshot AI. Guía oficial de uso de la API.
- Moonshot AI. Licencia de Kimi K3.
- vLLM. Soporte de inferencia para Kimi K3.


Deja una respuesta