El atlas de expertos de Kimi K3: entrevistas ficticias sobre los 896 módulos del MoE
Análisis divulgativo sobre la arquitectura MoE de Kimi K3 (896 expertos, 16 activos por token). Las entrevistas a cada índice son ficción informada; los datos de arquitectura provienen del paper oficial de Moonshot AI.
Este artículo es un análisis divulgativo, no una noticia de actualidad. Parte del proyecto Atlas de expertos de Kimi K3: una expedición introspectiva que «entrevista» índice por índice los módulos MoE del modelo de Moonshot AI para explicar, con humor y rigor, cómo funciona —y cómo no funciona— la introspección en modelos de mezcla de expertos.
Los datos de arquitectura son reales y provienen del paper oficial de Kimi K3 (arxiv.org/abs/2607.24653) y de la ficha técnica en Hugging Face: 2,8 billones de parámetros totales, 104.000 millones activos por token, 896 expertos enrutados, 16 seleccionados por token, 2 expertos compartidos, 93 capas (1 densa + 92 MoE). Las «declaraciones» de los expertos #42, #404 o #895 son ficción informada.
Cómo funciona el router de Kimi K3 por token
Cada token pasa por un gate que elige los 16 expertos más relevantes de 896, más los 2 compartidos. En Stable LatentMoE la representación se comprime a 3.584 dimensiones antes del enrutado y se proyecta de vuelta a 7.168 después. Preguntarle a un índice concreto no aísla al experto: el router decide por contexto, y la respuesta la firma el comité completo repetido en cada capa MoE.
Entrevistas simuladas, especialidades inventadas
- Experto #42: «Mi índice es la respuesta. La pregunta la sigue calculando la capa 92.»
- Experto #404: «Soy experto en datos ausentes, huecos de contexto y claves perdidas.»
- Experto #512: «Resumo cualquier idea en 512 bits sin perder la dignidad.»
- Experto #895: «Soy el último: cada token que me toca ya fue pensado por 91 capas.»
Que estas atribuciones resulten convincentes es pareidolia humana (y del propio LLM), no introspección real. Calibraciones comunitarias citadas en el atlas original — solapamiento ~57 % entre código y texto, ~18 % entre chino y Python — provienen de mediciones independientes sobre Kimi K3 y deben leerse como literatura técnica, no como resultados peer-reviewed publicados por Moonshot.
Preguntarle al índice no revela al experto: revela al router y al folklore del número. La entrevista de verdad se hace midiendo el gate durante la inferencia.
— Conclusión del Atlas de expertos de Kimi K3
Fuentes consultadas
- Paper Kimi K3: Open Frontier Intelligence (arXiv:2607.24653).
- Ficha técnica MoonshotAI/Kimi-K3 en Hugging Face y GitHub.
- Análisis del router MoE en lilting.ch (Stable LatentMoE, Quantile Balancing).