Recientemente, modelos de inteligencia artificial como DeepSeek V4-Flash, Qwen3.8-Flash y GLM-5.3-Flash, desarrollados en China, han irrumpido en el mercado. Estos destacan por su rendimiento cercano al de los modelos frontera de OpenAI y Anthropic, pero a una fracción del costo. Esta estrategia de alta inteligencia a bajo precio podría redefinir la competencia en el sector de la IA, presionando a las grandes tecnológicas occidentales.
Hace pocas semanas se lanzó DeepSeek V4-Flash, y esta semana llegaron dos modelos adicionales: Qwen3.8-Flash y GLM-5.3-Flash. Todos estos se distinguen por ser eficientes y, sobre todo, económicos. Anteriormente, los modelos chinos de pesos abiertos eran atractivos principalmente por su precio, pero ahora han logrado un avance significativo: ser casi tan competentes como los modelos frontera más avanzados de OpenAI y Anthropic. Esto indica una creciente presión por parte de China.
OpenAI, Anthropic y, en menor medida por ahora, Google, suelen ser los referentes en cuanto a modelos frontera con el máximo rendimiento. Sin embargo, las empresas chinas están comenzando a competir en una métrica que podría volverse igualmente crucial: la cantidad de inteligencia obtenida por cada dólar invertido. Los lanzamientos recientes de Alibaba, Z.ai y DeepSeek revelan una estrategia similar: acercarse lo máximo posible a los mejores modelos occidentales, mientras reducen drásticamente el costo de su utilización a niveles difíciles de ignorar.
Un ejemplo claro es Qwen3.8-Flash. Alibaba lo presenta como un adelanto de la futura arquitectura Qwen4: un modelo MoE (Mixture-of-Experts) con 125.000 millones de parámetros, de los cuales solo unos 6.000 millones están activos en cada momento. La compañía asegura que este modelo compite con otros mucho más grandes en áreas de programación y tareas agénticas, pero lo hace con una API que cuesta apenas 0,16 / 0,47 dólares por millón de tokens de entrada / salida. Este precio es notablemente bajo en comparación con la competencia, y la eficiencia es el pilar de una arquitectura que representa una amenaza para los modelos de OpenAI y Anthropic.
Pero GLM-5.3-Flash es igual de bueno o incluso mejor. Se dio a conocer recientemente como Ox Alpha, el misterioso modelo del que se hablaba y que resultó ser esta nueva creación de Z.ai. Posee 320.000 millones de parámetros, aunque solo activa 18.000 millones por token. Además, tiene un contexto de un millón de tokens y sus pesos abiertos ya han sido publicados bajo licencia MIT. Artificial Analysis le otorga 57 puntos en su Intelligence Index, muy cerca de los 60 de GLM-5.3 Max, pero su costo promedio por tarea es de 0,09 dólares, frente a los 0,68 dólares de su versión superior. La diferencia en inteligencia es mínima; la de precio, sustancial.
La pregunta que cobra cada vez más importancia es la siguiente: ¿cuánto podemos abaratar una IA antes de que deje de ser razonable pagar por otra? En DeepSeek V4-Flash, los 0,22/0,66 dólares por millón de tokens de E/S (tras el aumento de precios) ya eran una señal de alerta. Quizás no era el modelo más inteligente del mercado, pero sí era mucho más económico que GPT-5.6 Sol (4/20) o Claude Fable 5 (10/50). GLM-5.3-Flash (57 puntos), Qwen3.9 Flash Next (56) y DeepSeek v4 Flash (51) se encuentran muy cerca de Opus 5 (63), el modelo actualmente considerado más "inteligente". Y lo logran a un precio que es cien veces inferior.
Las empresas chinas están descubriendo cómo diseñar sus modelos para que sean cada vez más eficientes y, por lo tanto, más económicos. Técnicas como Mixture of Experts (para activar solo una pequeña parte de los parámetros totales), atención dispersa o lineal para evitar procesar innecesariamente todo el contexto, cachés más pequeñas y arquitecturas optimizadas para servir enormes cantidades de tokens demuestran estar logrando hitos espectaculares.
En el caso de GLM-5.3-Flash, hay otra señal llamativa: la infraestructura. Ox Alpha se ofreció de forma gratuita con una capacidad anunciada de hasta 100 billones de tokens diarios, y Z.ai ha confirmado que funcionaba íntegramente sobre chips chinos. SemiAnalysis añade que esa infraestructura alcanzó una eficiencia de hardware y un coste por token comparables a los de las GPU Nvidia. Los 100 billones de tokens diarios eran la capacidad anunciada, no el tráfico real, pero todo esto demuestra hasta qué punto China está empezando a construir no solo modelos competitivos, sino también la infraestructura doméstica necesaria para servirlos a gran escala. La industria de la IA necesitaba urgentemente abaratar costes para empezar a ser rentable, y eso es lo que está ocurriendo.
Los responsables de Artificial Analysis destacan una gráfica a la que llaman "Índice de Inteligencia vs. Coste por tarea del Índice de Inteligencia". En el eje X se representa el coste por tarea y en el Y, la "inteligencia" del modelo. Aquí, GLM-5.3-Flash rompe las métricas y es el que mejor supera la denominada Frontera de Pareto. Un modelo resulta especialmente atractivo cuando no se puede conseguir mucha más capacidad sin pagar un precio considerablemente mayor, y tanto GLM como Qwen logran desplazar esa frontera. No son los mejores, sin duda, pero ¿cuánto está uno dispuesto a pagar para obtener ese 5 o 10% adicional de "inteligencia"?
Para usuarios y, sobre todo, empresas que necesitan resolver millones de consultas, programar tareas relativamente rutinarias o desplegar cientos de agentes, no es imprescindible utilizar GPT-5.6 Sol o Claude Fable 5. Lo que se necesita es un modelo suficientemente bueno, fiable y económico. Esto ya se ha observado en otras ocasiones en la industria tecnológica: el producto técnicamente superior puede dominar la gama alta, pero el producto suficientemente bueno es el que logra hacerse con el volumen mayoritario gracias a su precio y disponibilidad.