En la Conferencia Mundial de Inteligencia Artificial 2026 (WAIC 2026), muchas empresas dijeron que reducir los costos de procesamiento de tokens (unidades de datos básicas que procesa la IA) se está convirtiendo en un objetivo común de toda la cadena industrial de IA. Desde chips, infraestructura informática hasta modelos de IA y enrutamiento inteligente (sistemas de selección automática de modelos de IA adecuados para cada tarea) se optimizan para mejorar la eficiencia y promover la comercialización.
Según Xinhua, en WAIC 2026 y la Cumbre Global de Gobernanza de IA, muchas empresas dijeron que la reducción de los costos de procesamiento de tokens se está volviendo central a medida que los agentes de IA (AI Agentes) aumentan significativamente los costos operativos.
En el campo de los chips de IA, se evalúa que los procesadores tensoriales (TPU) son mucho más eficientes en energía y costos por token que los procesadores gráficos (GPU) en tareas de entrenamiento e inferencia de IA a gran escala.
Yang Gongyifan, fundador de la empresa de chips TPU Zhonghao Xinying, dijo que el objetivo de la empresa es reducir a la mitad el costo por token en la próxima generación de chips y seguir reduciendo en las generaciones posteriores para promover la comercialización de la IA.
En la infraestructura informática, Liu Haifeng, presidente del Consejo de Administración de la Academia China de Ciencias (CAS), dijo que los costos de electricidad representan más del 20% del costo total del ciclo de vida del centro informático. Según él, la combinación de energía eólica, energía solar y almacenamiento de energía puede ayudar a reducir significativamente los costos operativos.
Las empresas que desarrollan modelos de IA también se centran en reducir los costos operativos. Tencent dice que el modelo de IA Hunyuan HY3 tiene un rendimiento equivalente a muchos modelos más grandes, pero los costos de uso son significativamente más bajos. Mientras tanto, Meituan dice que LongCat-2.0 es el primer modelo de la industria en aplicar un mecanismo gratuito para los tokens almacenados en cache. Estos son datos que la IA ha procesado previamente y guardado para su reutilización cuando se encuentran con solicitudes similares, lo que ayuda a los usuarios a no tener que pagar costos de procesamiento muchas veces.
Según la organización de evaluación de modelos de IA SuperCLUE, el modelo Kimi K3 obtuvo una puntuación un 18% más alta que el modelo clasificado en segundo lugar, mientras que el costo promedio para completar cada tarea es aproximadamente un 16% menor. Este resultado muestra que los nuevos modelos de IA no solo mejoran la capacidad de procesamiento, sino que también ahorran cada vez más costos de uso.
Además, la tecnología de "routing de modelos inteligentes" también se está convirtiendo en un tema de interés en WAIC 2026. Según PPIO, esta tecnología puede seleccionar modelos de IA adecuados para cada tarea, mejorando así la eficiencia de procesamiento en aproximadamente un 20% y reduciendo los costos de los tokens en un 50-60%.