« Impressionnant » : même Elon Musk s’abandonne au modèle ouvert d’IA chinois Kimi K3. Ce n’est pas pour moins
C’est bon, c’est joli et c’est (assez) pas cher. Nous l’avions rencontré il y a quelques jours, mais Kimi K3, le nouveau modèle d’IA ouverte de la startup chinoise Moonshot AI, fait sensation. À tel point qu’ils ont dû suspendre les nouveaux abonnements parce qu’ils ne pouvaient pas répondre à une telle demande.
Encore un tournant pour l’IA chinoise. Kimi K3 est le plus grand modèle d’IA à poids ouverts jamais publié, avec des chiffres qui rivalisent probablement avec ceux des modèles frontières d’Anthropic et OpenAI, qui ne fournissent pas d’informations sur la taille de leurs modèles. Ces 2,8 milliards de paramètres font la différence et expliquent en grande partie pourquoi ce modèle représente un véritable saut de qualité selon tous les benchmarks publiés.

« Génial ». Elon Musk lui-même a publié un single « Awesome » sur son compte X/Twitter en réponse à l’analyse très complète des performances d’Artificial Analysis. Son comportement agent dépasse celui de l’Opus 4.8 et seul Fable 5 le surpasse, mais dans un benchmark spécifique il va encore plus loin et est le meilleur de tous les modèles évalués par cette firme, y compris ceux d’OpenAI et Anthropic.

Source : Analyse artificielle.
Plus de tests. En programmation, il est meilleur qu’Opus 4.8 et GPT-5.5, mais inférieur à Fable 5 ou GPT-5.6, et tous les tests indépendants valident ces résultats : nous sommes confrontés à un modèle qui, au moins sur le papier, rivalise directement avec le meilleur d’Anthropic et d’OpenAI jusqu’à présent. Aucun modèle chinois ne s’en était approché jusqu’à présent : le GLM-5.2, bien que remarquable, rivalisait davantage avec le GPT-5.5 et le Sonnet 5 qu’avec les modèles frontières américains.

Source : Analyse artificielle
Gigantesque… et pas si bon marché. DeepSeek a montré qu’il était possible d’accéder à des modèles réellement performants à un prix très abordable, et récemment GLM-5.2 a proposé exactement la même chose : il est possible d’atteindre 90 % de la capacité des modèles frontières tels que l’Opus 4.8, mais à 20 % du coût. Ce qui est curieux, c’est qu’avec Kimi K3 la tendance change : c’est un modèle plus abordable que Fable 5 ou GPT-5.6, mais pas autant qu’on pourrait s’y attendre : le coût par million de jetons d’entrée/sortie est de 3/15 dollars, tandis que dans Fable 5 il coûte 10/50, Opus 4.8 coûte 5/25 et GPT-5.6 Sol coûte 5/30.
Des jetons partout. L’un des facteurs qui influence probablement ce rapport qualité/prix est le grand nombre de jetons que Kimi K3 semble utiliser pour répondre. C’est un modèle qui « réfléchit beaucoup » et qui, même s’il améliore sans aucun doute la précision et la capacité du modèle, l’amène également à générer des factures plus élevées pour l’utilisateur. Le propre rapport d’Artificial Analysis va plus loin : le coût par tâche dans sa batterie de tests est de 0,95 $, au niveau de 1,04 $ de GPT-5.6 Sol et certainement moins cher que Fable 5 (2,75 $), mais aussi beaucoup plus cher que Grok 4.5 (0,31 $) ou GLM-5.2 (0,47 $).
Le test du pélican. L’analyste Simon Willinson a pu tester le modèle pour effectuer un test pour évaluer le comportement de tous ces développements : faire en sorte que le modèle génère une image SVG d’un pélican sur un vélo. Lors de leurs tests, l’image était de très bonne qualité, mais elle a généré près de 17 000 jetons pour la réponse avec un coût de tâche de 25 centimes. Ce test n’est pas trop concluant, mais il révèle que pour une tâche simple, le résultat, bien que remarquable, n’est pas particulièrement efficace en termes de consommation de jetons.
La cybersécurité, l’inconnu. Contrairement aux derniers modèles d’Anthropic ou d’OpenAI, Moonshot AI ne semble pas intéressé pour le moment par son utilisation dans le domaine de la cybersécurité. Il n’y a aucune mention de ces capacités potentielles dans les notes de version, mais cela ne veut pas dire que cela ne fonctionne pas. Le CTO de Vercel, Malte Ubl, a expliqué que même s’il ne s’agit pas du modèle d’IA le plus avancé dans ce domaine, après avoir effectué plusieurs tests, il semble être un modèle qui peut être très utile pour trouver et corriger des vulnérabilités.


La demande, à travers les nuages. L’attente générée par ce modèle a été telle que l’entreprise a annoncé qu’elle suspendait les nouveaux abonnements. Cela leur permettra de pouvoir traiter toutes les demandes d’utilisation sans nuire à l’expérience des anciens et des nouveaux utilisateurs. Une décision frappante qui semble clarifier une réalité : ils ne peuvent pas faire face.
À Simseo | Le gigantesque Qwen 3.8 est un autre signe inquiétant pour les États-Unis : leur avantage en matière d’IA s’évapore
