Gemini 4 balaie les benchmarks et remet Google dans la course à l’IA
L’image officielle de Google semble tirée du nouveau film « Les Quatre Fantastiques », mais qu’importe : elle représente le retour à une carrière qui semblait abandonnée. Depuis des mois, l’entreprise est un peu à la dérive dans la lutte pour les modèles frontières, mais avec Gemini 4 Argon tout indique, du moins selon les benchmarks, que Google se positionne comme l’une des trois entreprises proposant les modèles les plus puissants au monde. Et le problème est : les benchmarks.
Google est de nouveau là. Gemini 4 Argon arrive avec des résultats de référence qui le placent aux côtés d’OpenAI et d’Anthropic dans la lutte pour les modèles frontières les plus puissants au monde. L’analyse artificielle lui donne 53 points dans son indice d’intelligence, le même que GPT-6 Astra, mais selon les tests internes de Google, Gemini 4 est une bête qui surpasse Opus 5.5 et Fable 5.1 dans divers tests. Est-ce vraiment aussi bon que le dit Google ?

Les tests internes semblent indiquer clairement que le Gemini 4 Argon est actuellement le meilleur modèle au monde. Nous n’en sommes pas sûrs.
Nous ne pouvons pas savoir si c’est le meilleur. Bien que les données de Google et d’Artificial Analysis donnent de nombreux indices sur les fantastiques performances du Gemini 4 Argon, le problème est que le modèle n’a pas été largement diffusé. Il sera d’abord accessible à un groupe limité de « testeurs de confiance » et de spécialistes de la cybersécurité via son programme Fairwind. Le gouvernement américain analyse également ce modèle, qui devient courant pour éviter les blocages gouvernementaux.
Certains salariés l’ont essayé et l’histoire se complique. Bloomberg a parlé avec des employés et là, la capacité du modèle commence à être un peu plus confuse. Ils affirment que même si Argon obtient des résultats fantastiques aux tests, lorsqu’ils l’utilisent sur certaines tâches de programmation, il ne réussit pas très bien. Google le nie et Sundar Pichai affirme que ses équipes l’utilisent largement et obtiennent de bons résultats. Il semble y avoir des divisions en interne quant à l’aspect pratique du modèle, et il est impossible de savoir comment il fonctionne pour chaque personne jusqu’à ce que nous puissions le tester.

Google revient dans la course, mais on est encore un peu loin des modèles de Claude qui sont toujours en avance selon l’Analyse Artificielle.
Un benchmark n’est que cela, un benchmark. Les tests comme ceux dédiés à la programmation ou à l’automatisation tentent de servir de cas réels, mais ils doivent encore être des tâches délimitées, vérifiables avec des conditions qui peuvent être reproduites encore et encore. Comme nous le savons tous, notre quotidien est beaucoup moins « propre », et ceux qui utilisent l’IA peuvent travailler avec d’énormes référentiels, des dépendances ou une documentation imparfaite. Même si un modèle fonctionne très bien lors des tests, il peut ne pas être aussi bon qu’il le paraissait dans l’expérience utilisateur réelle. Ici, cela dépend du cas d’utilisation et bien sûr de l’opinion de l’utilisateur. Ce qui est bon pour certains peut ne pas l’être pour d’autres.
Moins d’hallucinations, mais… L’analyse artificielle indique que le taux d’hallucinations de Gemini 4 Argon est de 15% en AA-Omniscience tandis que GPT-6 Astra hallucine à 50%, une énorme différence. Ce qui se passe, c’est qu’Astra atteint une plus grande précision dans ce test. Ce qui se passe ici, c’est que Gémeaux 4 n’hallucine pas autant car il est capable de dire « je ne sais pas » au lieu de donner une réponse prévue. C’est une voie raisonnable à suivre, mais cela montre également que « 15 % » nécessite un contexte.

Google veut également rivaliser sur les prix. Gemini 4 aura initialement un prix promotionnel de 2/10 $ par million de jetons d’entrée/sortie, ce qui est important surtout maintenant que l’utilisation de ces modèles dans des tâches agentiques pendant des heures peut être très coûteuse. Selon l’intelligence artificielle, avec ce coût réduit, Gemini 4 parvient à avoir un coût par tâche 40 % inférieur à celui de GPT-6 Astra. Mais bien sûr, cela ne durera pas éternellement, et Google doublera les prix par la suite pour les laisser à 4/20$, ce qui est déjà un coût plus difficile à assumer pour un usage intensif. Nous espérons là qu’une potentielle variante Flash atténuera cette section.
À Simseo | Suivre l’IA en 2026 est impossible : le défi de découvrir quel est le meilleur chatbot aujourd’hui
