La competencia en inteligencia artificial no solo se centra en modelos pequeños y eficientes para dispositivos modestos, sino también en el desarrollo de IA de gran escala. China se ha posicionado como un actor clave en ambos frentes, con sus principales tecnológicas apostando por modelos que superan el billón de parámetros, redefiniendo los límites del tamaño y la capacidad computacional. Esta estrategia dual busca cubrir un amplio espectro de necesidades, desde la eficiencia hasta la complejidad de tareas.
No toda la evolución de la inteligencia artificial se desarrolla en grandes centros de datos. Existe también una vertiente, más cercana al usuario, que busca crear modelos lo suficientemente reducidos como para funcionar con menos memoria, menor capacidad de cálculo y en dispositivos más sencillos. China se ha convertido en un actor relevante en este ámbito con familias de modelos como Qwen o MiniCPM. Sin embargo, mientras esa competencia avanza hacia modelos más pequeños, algunas de sus mayores empresas tecnológicas están comenzando a invertir en la dirección opuesta: hacia modelos de cientos de miles de millones de parámetros.
Las cifras reflejan claramente la magnitud de esta escalada. DeepSeek-V3 apareció con 671.000 millones de parámetros totales, mientras que Moonshot AI llevó Kimi K2 hasta el billón. El incremento se ha acelerado en 2026: Kimi K3 alcanza los 2,8 billones y Alibaba ha posicionado Qwen3.8-Max en 2,4 billones. Estas son cantidades totales, y esa última palabra es crucial: no implica que todos esos parámetros se activen en cada fase del procesamiento. Esto es precisamente lo que necesitamos comprender a continuación.
La arquitectura no es nueva. En 2023, un análisis de SemiAnalysis sugirió que GPT-4 podría emplear un diseño de 'Mixture of Experts' (MoE), aunque OpenAI nunca confirmó públicamente este detalle. La lógica es simple: en lugar de activar todos los parámetros en cada paso, el sistema solo utiliza una parte. Qwen3.8-Max lo ilustra bien: aunque reúne 2,4 billones de parámetros, emplea aproximadamente 95.000 millones por paso.
Un mayor tamaño no siempre se traduce en una mejor calidad. El número de parámetros indica el tamaño, pero no funciona como una clasificación automática de inteligencia o precisión. DeepMind lo demostró en 2022 con Chinchilla: este modelo, con 70.000 millones de parámetros, superó a Gopher, que tenía 280.000 millones, en casi todas las tareas evaluadas, utilizando el mismo presupuesto de cómputo para el entrenamiento. Chinchilla, además, había sido entrenado con aproximadamente cuatro veces más datos. La arquitectura, la cantidad y la calidad de los datos, así como los recursos de computación, también influyen de manera decisiva en el resultado.
La siguiente frontera ya está sobre la mesa. Alibaba confirmó el 22 de septiembre que Qwen 4 está en fase de entrenamiento y adelantó que su hoja de ruta para Qwen 4.5 y Qwen 5 contempla modelos de entre 5 y 10 billones de parámetros. ByteDance estaría buscando una escala similar, según Financial Times, aunque la compañía no lo ha confirmado públicamente. Tampoco es posible hacer una comparación directa entre los modelos chinos y estadounidenses más recientes: OpenAI y Anthropic no detallan el número de parámetros en las especificaciones públicas de GPT-5.6 Sol y Claude Fable 5.1.
No todos los modelos cumplen la misma función. Como se mencionó al principio, los modelos pequeños son ideales cuando se necesita contener la memoria, el cómputo y los costos, o para integrar la IA directamente en dispositivos personales. Los modelos de gran escala persiguen un objetivo diferente: una capacidad más amplia para abordar tareas más exigentes y variadas, aunque esto requiera una infraestructura mucho mayor. La estrategia china no consiste en reemplazar unos modelos por otros, sino en cubrir ambos extremos: modelos compactos donde la eficiencia es prioritaria y sistemas colosales donde compensa asumir el costo de escalar.