Les États-Unis possèdent les modèles les plus chers et les plus performants au monde. Le problème est que la Chine les propose presque aussi bons et bien moins chers.

Les États-Unis possèdent les modèles les plus chers et les plus performants au monde. Le problème est que la Chine les propose presque aussi bons et bien moins chers.

Il y a quelques semaines, DeepSeek V4-Flash a été lancé, et cette semaine nous avons vu comment sont arrivés deux modèles plus spectaculaires : Qwen3.8-Flash et GLM-5.3-Flash. Tous se distinguent par leur qualité, leur beauté et surtout leur prix bon marché. Auparavant, les modèles chinois à poids ouvert n’étaient attrayants que pour leur prix, mais ils ont maintenant réalisé quelque chose d’étonnant : être presque aussi bons que les modèles frontières les plus avancés d’OpenAI et d’Anthropic. Cuidadin.

La Chine se resserre. OpenAI, Anthropic et (à une plus grande distance pour l’instant) Google sont généralement toujours les protagonistes lorsqu’il s’agit de parler des modèles frontières les plus performants, mais les entreprises chinoises commencent à rivaliser sur un autre indicateur qui pourrait finir par être tout aussi important : la quantité d’intelligence que l’on obtient pour chaque dollar dépensé. Les derniers lancements d’Alibaba, Z.ai et DeepSeek montrent une stratégie très similaire : se rapprocher le plus possible des meilleurs modèles occidentaux tout en réduisant leur coût d’utilisation à des niveaux quasiment impossibles à ignorer.

Qwen3.8-Flash, un exemple clair. Alibaba le présente comme un aperçu de la future architecture Qwen4 : un modèle MoE (Mixture-of-Experts) de 125 milliards de paramètres dans lequel seulement 6 milliards environ sont actifs à un moment donné. La société prétend être en concurrence avec des modèles beaucoup plus grands dans les domaines de la programmation et des tâches agents, mais elle le fait avec une API qui ne coûte que 0,16 $/0,47 $ par million de jetons d’entrée/sortie. C’est un prix dérisoire si on le compare à la concurrence, et l’efficacité est ici ce qui constitue le pilier d’une architecture qui menace celle des modèles OpenAI et Anthropic.

Capture d'écran 2026 08 27 À 14 39 48

En termes de rapport prix/performance, personne ne se rapproche actuellement du GLM-5.3-Flash. GPT5.6 Luna ne fait pas mal, mais il est plus « stupide », pour ainsi dire. Source : Analyse artificielle.

Mais GLM-5.3-Flash est aussi bon, voire meilleur. On le connaissait ces jours-ci sous le nom de Ox Alpha, le modèle mystérieux dont tout le monde parlait et qui s’avère être ce nouveau modèle Z.ai. Il possède 320 milliards de paramètres, bien qu’il n’en active que 18 milliards par jeton. Il a également un contexte d’un million de jetons et ils ont déjà publié leurs poids ouverts avec une licence MIT. L’analyse artificielle lui donne 57 points dans son indice d’intelligence, très proche des 60 du GLM-5.3 Max, mais son coût moyen par tâche est de 0,09 dollars, contre 0,68 dollars pour son frère aîné. La différence d’intelligence est minime ; le prix, énorme.

La question qui devient de plus en plus importante. DeepSeek et les modèles ouverts des entreprises chinoises ont constamment posé la même question ces derniers mois : à quel point pouvons-nous rendre une IA moins chère avant qu’il ne soit plus logique d’en payer une autre ? Dans DeepSeek V4-Flash, les 0,22/0,66 dollars par million de jetons d’E/S (après l’augmentation des prix) étaient déjà un signe d’avertissement. Ce n’était peut-être pas le modèle le plus intelligent du marché, mais il était bien moins cher que le GPT-5.6 Sol (4/20) ou le Claude Fable 5 (10/50).

Capture d'écran 2026 08 27 Au 15 01 54
Capture d'écran 2026 08 27 Au 15 01 54

GLM-5.3-Flash (57 points), Qwen3.9 Flash Next (56) et DeepSeek v4 Flash (51) sont très, très proches de l’Opus 5 (63), le modèle le plus « intelligent » aujourd’hui. Et ils y parviennent à un prix 100 fois inférieur. Source : Analyse artificielle.

Indépendance occidentale. Les entreprises chinoises découvrent comment concevoir leurs modèles pour qu’ils soient de plus en plus efficaces et donc bon marché. Des techniques telles que le mélange d’experts (pour activer seulement une petite partie du total des paramètres), une attention clairsemée ou linéaire pour éviter de traiter inutilement l’ensemble du contexte, des caches plus petits et des architectures optimisées pour servir d’énormes quantités de jetons s’avèrent de plus en plus franchir des étapes spectaculaires.

Des jetons à gogo. Dans le cas du GLM-5.3-Flash, il y a aussi un autre signe frappant : l’infrastructure. Ox Alpha était proposé gratuitement avec une capacité annoncée allant jusqu’à 100 milliards de jetons par jour, et Z.ai a maintenant confirmé qu’il fonctionnait entièrement sur des puces chinoises. SemiAnalysis ajoute que cette infrastructure a atteint une efficacité matérielle et un coût par jeton comparables à ceux des GPU Nvidia. Les 100 milliards de jetons chaque jour représentaient la capacité annoncée, et non le trafic réel, mais tout cela démontre à quel point la Chine commence à construire non seulement des modèles compétitifs, mais aussi l’infrastructure nationale nécessaire pour les servir à grande échelle.

La frontière Pareto. Ces derniers temps, les responsables de l’analyse artificielle mettent particulièrement en avant un graphique qu’ils appellent « Indice d’intelligence par rapport au coût par tâche de l’indice d’intelligence ». Sur l’axe X se trouve le coût par tâche. Dans le Y, à quel point le modèle est « intelligent ». Là, GLM-5.3-Flash brise les métriques et est celui qui surmonte le mieux la soi-disant frontière de Pareto. Un modèle est particulièrement attrayant lorsque vous ne pouvez pas obtenir beaucoup plus de capacité sans payer beaucoup plus, et GLM et Qwen parviennent tous deux à repousser cette limite. Ce ne sont pas les meilleurs, bien sûr, mais combien êtes-vous prêt à payer pour obtenir ces 5 ou 10 % « d’intelligence » supplémentaires ?

Des modèles assez bons. Pour les utilisateurs et notamment les entreprises qui ont besoin de résoudre des millions de requêtes, de planifier des tâches relativement routinières ou de déployer des centaines d’agents, il n’est pas nécessaire d’utiliser GPT-5.6 Sol ou Claude Fable 5. Ce dont vous avez besoin, c’est d’un modèle suffisamment performant, fiable et bon marché. Nous avons déjà vu quelque chose de similaire auparavant dans l’industrie technologique : le produit techniquement le meilleur peut dominer le haut de gamme, mais le produit assez bon est celui qui parvient à s’approprier la majorité du volume grâce à son prix et sa disponibilité.

À Simseo | Apple a décidé de ne pas entrer dans la guerre de l’IA car elle estime avoir quelque chose de plus important : la « porte » d’entrée