Gemini 4 peut écrire un million de tokens en une seule fois : le produit n'est plus du chat mais un travail long et autonome

Gemini 4 peut écrire un million de tokens en une seule fois : le produit n’est plus du chat mais un travail long et autonome

Jusqu’à cette semaine, un modèle Gemini pouvait générer au maximum 64 000 par réponse. Gemini 4 Argon, dévoilé hier soir par Google, porte ce plafond à un million. Pour que cela fonctionne, l’API publie une fonction qui met en pause les réponses longues et les reprend lors d’appels successifs, afin que le modèle ne s’arrête pas à mi-chemin lorsque la requête expire.

Pourquoi c’est important. Un million équivaut à environ 750 000 mots. Il y a de la place pour « Guerre et Paix » et il y a encore beaucoup de place pour « Cent ans de solitude ». Mais Argon n’a pas cette limite pour écrire un roman russe sur les guerres napoléoniennes. Google a augmenté cette limite afin que le modèle puisse fonctionner plus longtemps sans s’arrêter. L’unité de produit n’est donc plus la réponse autant que la commande.

Les exemples de l’annonce vont là-bas :

  • Il existe des agents Argon qui migrent le code interne C et C++ vers Rust, y compris l’une des plus de 800 000 lignes.
  • D’autres ont commencé à analyser la télémétrie de tous leurs centres de données et ont libéré plus de 300 TiB de mémoire (environ 330 To).

Personne ne leur a rien demandé. On leur a donné un travail.

Le contexte. Début 2025, le meilleur modèle réalisait, avec 50 % de réussite, des tâches qui prennent moins d’une heure à une personne, selon le METR. Un an plus tard, cet horizon était déjà d’environ 16 à 20 heures. Et METR reconnaît qu’au dessus, ses tests ne mesurent plus bien.

Avec des jours comme celui-ci, le chat reste dans une sorte de fenêtre : vous arrivez, quittez la commande et revenez un peu plus tard pour le résultat. Tout ce qui compte se passe entre les deux et personne n’a besoin d’en être conscient. Et encore moins que quelqu’un touche à quoi que ce soit.

La piste de l’argent. Artificial Analysis estime que chaque tâche de son index coûte 1,99 $ avec Argon, soit 60 % de ce qu’elle coûte avec GPT-6 Astra. Il y a un piège :

  • Argon dépense en moyenne 62 000 sorties par tâche ; Astra, environ 27 000. C’est moins cher parce que son prix est inférieur, et non parce qu’il fonctionne moins.
  • À la fin de la remise de lancement, la tâche atteindra 3,98 $, soit plus que son rival.

Cela fait trois ans que l’industrie est en concurrence sur les prix, et ce chiffre explique de moins en moins la facture. Ce qui explique cela, c’est le montant que le modèle décide de dépenser, et cela est décidé par celui qui le vend. Comme dans un taxi : il est très important que le tarif du compteur soit plus cher ou moins cher, mais aussi si le chauffeur de taxi utilise des raccourcis ou s’il fait partie de ceux qui font des détours, car alors ce qui est le moins cher peut être plus cher.

Rien n’indique que Google va gonfler le taximètre d’Argon, mais ses clients devront demander un devis personnalisé et fixer des limites de dépenses pour éviter les frayeurs.

Oui, mais. La lecture d’une réponse de 750 000 mots prendrait environ 50 heures. Ainsi, surveiller ne peut plus signifier lire ce que fait l’IA, mais simplement vérifier le résultat, ce qu’elle délivre. Et là, Argon hésite : dans AA-Briefcase, un test de travail de bureau, il a battu le record de conformité à la rubrique, mais sa note en qualité d’analyse et de présentation est pire. Il coche toutes les cases, mais cela ne veut pas dire qu’il fait mieux le travail.

De plus, plus la mission est longue, plus il y a de place pour les raccourcis. METR a été surpris en train de tricher dans au moins 16 % des exécutions réussies sur des tâches d’une durée de huit heures ou plus. Google surveille lui-même le raisonnement d’Argon pour le supprimer s’il s’écarte, et audite manuellement ses migrations avant de les mettre en production. Il traite son propre modèle comme un sous-traitant en qui il n’a pas entièrement confiance.

La grande question. Qui est responsable si quelque chose ne va pas ? Lorsque l’IA répondait seulement, elle décidait qui lisait la réponse. Avec des horaires de travail que personne n’a suivi pas à pas car irréalisables, la responsabilité est répartie entre celui qui commande, qui révise et qui vend le modèle.

Pendant ce temps, le professionnel exécutera de moins en moins et agira davantage en client et en auditeur : savoir demander et savoir vérifier, qui était autrefois l’affaire du chef de projet, devient l’affaire de tout le monde. Il va falloir se réveiller.

Et maintenant quoi. Depuis plus de trois ans, les Gémeaux et leurs rivaux sont mesurés par la façon dont ils répondent à nos questions, mais les prochains seront mesurés par ce qu’ils font alors que personne ne les regarde. Il est donc difficile de le vérifier plus tard.

Image en vedette | Simseo avec Magnifique

À Simseo | Google permet désormais à n’importe quel agent IA de contrôler votre maison : voici comment fonctionne Home MCP