Lors de la Conférence mondiale sur l'intelligence artificielle 2026 (WAIC 2026), de nombreuses entreprises ont déclaré que la réduction des coûts de traitement des tokens (unités de données de base traitées par l'IA) devient un objectif commun de l'ensemble de la chaîne industrielle de l'IA. Des puces, des infrastructures informatiques aux modèles d'IA et aux routes intelligentes (systèmes de sélection automatique de modèles d'IA adaptés à chaque tâche) sont optimisés pour améliorer l'efficacité et promouvoir la commercialisation.
Selon Xinhua, lors du WAIC 2026 et du Sommet mondial sur la gestion de l'IA, de nombreuses entreprises ont déclaré que la réduction des coûts de traitement des tokens devient un point central, car les agents d'IA (AI Agents) augmentent considérablement les coûts d'exploitation.
Dans le domaine des puces d'IA, les processeurs tenseurs (TPU) sont considérés comme ayant une efficacité énergétique et un coût par token bien meilleurs que les processeurs graphiques (GPU) dans les tâches de formation et de raisonnement en IA à grande échelle.
Yang Gongyifan - fondateur de la société de puces TPU Zhonghao Xinying - a déclaré que l'objectif de l'entreprise est de réduire de moitié le coût par token dans la prochaine génération de puces et de continuer à réduire dans les générations suivantes afin de promouvoir la commercialisation de l'IA.
Dans les infrastructures informatiques, Liu Haifeng - président du conseil d'administration de l'Académie chinoise des sciences (CAS) - a déclaré que le coût de l'électricité représente plus de 20% du coût total du cycle de vie du centre informatique. Selon lui, la combinaison de l'énergie éolienne, de l'énergie solaire et du stockage d'énergie peut contribuer à réduire considérablement les coûts d'exploitation.
Les entreprises qui développent des modèles d'IA se concentrent également sur la réduction des coûts d'exploitation. La société Tencent a déclaré que le modèle d'IA Hunyuan HY3 a des performances équivalentes à de nombreux modèles plus grands, mais des coûts d'utilisation nettement inférieurs. Pendant ce temps, la société Meituan a déclaré que LongCat-2.0 est le premier modèle de l'industrie à appliquer un mécanisme gratuit pour les tokens stockés dans un cache. Ce sont des données qui ont été traitées à l'avance par l'IA et enregistrées pour être réutilisées en cas de demande similaire, ce qui permet aux utilisateurs de ne pas avoir à payer de frais de traitement plusieurs fois.
Selon l'organisation d'évaluation de modèles d'IA SuperCLUE, le modèle Kimi K3 obtient une note supérieure de 18% au modèle classé deuxième, tandis que le coût moyen pour effectuer chaque tâche est inférieur d'environ 16%. Ces résultats montrent que les nouveaux modèles d'IA non seulement améliorent la capacité de traitement, mais sont également de plus en plus rentables.
Par ailleurs, la technologie de "routage de modèles intelligents" devient également un sujet d'intérêt au WAIC 2026. Selon la société PPIO, cette technologie peut choisir un modèle d'IA adapté à chaque tâche, améliorant ainsi d'environ 20% l'efficacité du traitement et réduisant de 50 à 60% le coût du token.