Anthropic vient de sortir Fable 5.1, son modèle d’IA le plus puissant. Il y a un problème : il n’ose pas nous laisser l’utiliser entièrement
Anthropic vient de présenter le Claude Fable 5.1, qui sur le papier est son modèle le plus performant à ce jour. Dans l’évaluation indépendante d’Analyse Artificielle, il atteint 66 points, devant le 63 de l’Opus 5 ou le 61 du GPT-5.6 Soly Grok 4.6. Il y a des améliorations notables et spectaculaires dans les benchmarks de programmation, la recherche scientifique et les tâches agents longues, mais attention : plusieurs éléments déterminent ces performances.
Un modèle, deux portes d’entrée. Anthropic explique dans sa documentation que Fable 5.1 et Mythos 5.1 appartiennent à la même classe de modèles mais ont des niveaux de protection différents. Fable 5.1 est la version généralement disponible, tandis que Mythos, comme d’habitude, est réservé aux partenaires et organisations de confiance car il offre des fonctionnalités particulièrement sensibles dans le domaine de la cybersécurité.
L’ère des modèles plafonnés. Nous ne sommes plus seulement confrontés à une phase dans laquelle les entreprises d’IA développent différents modèles : ce que fait ici Anthropic est quelque chose de similaire à ce que fait l’industrie automobile : elle fabrique une voiture équipée de tout, mais qu’elle superpose artificiellement de sorte que si nous voulons utiliser certains extras, nous les payons. Quelque chose de similaire se produit dans Fable 5.1 et Mythos 5.1, mais la différence réside simplement dans ce que chaque modèle nous permet de faire avec les mêmes capacités de base.

Des repères en petits caractères. Lorsque Artificial Analysis a évalué Fable 5.1, elle l’a fait en devant travailler avec le système Anthropic déjà présent dans Fable 5 : si une requête est considérée comme « dangereuse », elle passe à un modèle moins performant, qui dans ce cas était Claude Opus 4.8. Et dans cette analyse, 4 % des jetons de sortie de son Intelligence Index provenaient de ce « mode sans échec ». Le résultat de 66 points finalement obtenu aurait pu être encore plus élevé.
De moins en moins de choses doivent lui être expliquées. Alex Albert d’Anthropic résume son expérience de manière révélatrice : vous pouvez lui donner quelques phrases vagues et confuses, et Fable 5.1 comble généralement ce qui manque à lui seul. Cette capacité est précisément ce qui rend les agents meilleurs : ils ont besoin de moins d’instructions intermédiaires pour atteindre l’objectif et ils n’ont pas besoin d’invites ultra détaillées et très longues.

Fable 5.1 a très bien dessiné le vélo pélican SVG de Simon Willinson, mais le coût est effrayant : 3,3 $.
Une IA avec plus de « goût ». Ethan Mollick, qui a eu un accès précoce au modèle, affirme que l’amélioration la plus nette apparaît dans les travaux de longue durée qui nécessitent « du jugement et du goût ». C’est une observation curieuse car elle montre comment les agents peuvent désormais travailler pendant des heures avec une idée claire de ce qui vaut la peine de faire, quand une solution est suffisamment bonne ou quand cela vaut la peine de changer de stratégie. Par conséquent, en théorie, cela nécessite également moins de supervision. Le test Pelican SVG de Simon Willinson a également été un succès (avec un effort de raisonnement maximal), même si le coût était énorme : 3,3 $.
C’est moins cher… Anthropic maintient le prix de base de Fable 5 (10/50 $ par million de jetons d’entrée/sortie), mais a réduit le coût des lectures de cache de 75 %, passant d’un dollar à 0,75 $. C’est théoriquement important car les agents d’IA qui travaillent longtemps réutilisent constamment le même contexte et bénéficient de sa démarque. Selon Anthropic, cela implique des économies de 25 % sur les chargements réguliers et jusqu’à 45 % sur les travaux agents.

Dans la mesure du coût par tâche de l’analyse artificielle, Fable 5.1 est de loin le modèle le plus cher au monde. Source : Analyse artificielle.
… mais ce n’est pas le cas. Cependant, les tests d’Analyse Artificielle ont montré qu’au final cela ne signifie pas une réelle réduction du coût par tâche. La raison est simple : Fable 5.1 réfléchit et écrit beaucoup (pour donner les meilleures réponses possibles), ce qui fait augmenter considérablement la consommation par tâche. Le coût moyen d’une tâche dans Fable 5.1 et le niveau de raisonnement « Max » est de 3,76 $, soit 20 % de plus que Fable 5 pour cette simple raison : il génère 1,7 fois plus de jetons de sortie.
Prudence. Cette publication intervient juste après que l’entreprise ait détaillé des incidents troublants dans les évaluations de sécurité. Ils ont également rencontré des problèmes qui les ont amenés à interrompre temporairement certains types de formation et à renforcer leurs contrôles. Avec Mythos 5.1 et Fable 5.1, cette différenciation des capacités confirme la tension que l’on vit actuellement autour de la sécurité de ces modèles d’IA.
Images | Simseo avec Magnifique
À Simseo | « Claudés » est né, le dialecte que seuls ceux qui passent la journée à parler à leurs agents IA comprennent
