Sadya Nadella, PDG de Microsoft : « Notre objectif est d’apporter une intelligence gratuite à chaque foyer et sur chaque ordinateur »
En juillet 1991, un jeune Indien de 23 ans, aux cheveux intacts, a assisté à une conférence de développeurs Microsoft qui a changé sa vie. Un an plus tard, Nadella travaillait chez Microsoft et le reste, comme on dit, appartient à l’histoire.
Hier, Nadella a raconté cette histoire lors de l’événement conjoint Microsoft et Nvidia également à San Francisco. Et pour lui, cet événement pourrait marquer un autre tournant car, dit-il, « notre objectif est d’apporter une intelligence illimitée à chaque foyer et à chaque bureau Windows ». Et son plan pour réaliser quelque chose comme ceci était simple :
Redonnez vie au PC grâce à « l’intelligence hybride ».
Et faites-le avec une stratégie très raisonnable : pour lui, dans cette nouvelle et fascinante ère de l’IA, nous pouvons bien sûr utiliser les modèles d’IA dans le cloud que nous utilisons depuis trois ans, mais en plus de ces modèles, nous pouvons utiliser des modèles d’IA locaux.
« L’intelligence hybride » a du sens
C’est là qu’intervient ce que l’on appelle « l’intelligence hybride », un nouveau concept marketing que Microsoft Pavan Davuluri, directeur de Microsoft, a expliqué simplement :
« Nous nous dirigeons vers un avenir où l’intelligence hybride est toujours disponible. Fonctionnant sur site lorsque cela est logique, passant au cloud si vous en avez besoin et apportant le meilleur des deux mondes. »

Le discours était convaincant. Cela avait du sens, car nous examinons comment la combinaison des deux options peut être une excellente idée, mais ici, Microsoft a façonné cette idée en sa faveur. Il l’a fait en laissant entendre que cette intelligence hybride dynamiserait une fois de plus le monde du PC – qui a toujours été le monde de Microsoft – car ses nouveaux équipements nous permettent de profiter de quelque chose de merveilleux :
« Jetons gratuits. »
C’est comme ça qu’ils en parlaient. Lorsque vous disposez d’une machine capable de fonctionner avec des modèles d’IA locaux, ce que vous générez avec ces machines est apparemment gratuit. Vous n’êtes pas obligé de payer les abonnements ChatGPT ou Claude, et la qualité des modèles disponibles est aujourd’hui vraiment remarquable.

Des jetons gratuits ?
Dans la démo réalisée par Kayla Cinnamon, une autre dirigeante de Microsoft, c’était clair : en utilisant GitHub Copilot avec son nouveau modèle de routeur intelligent, on pouvait voir comment une certaine tâche avait utilisé certains jetons « payants », mais on pouvait aussi voir combien de jetons elle avait générés « gratuitement » grâce à l’utilisation de modèles locaux.
L’idée est très puissante et, comme nous l’avons dit, pleine de sens. Cinnamon a expliqué que vous pouvez laisser votre ordinateur allumé avec GitHub Copilot exécuté sur votre projet et « je recevrais tous ces jetons impayés pendant que je dors ».
C’est vrai : les tokens générés par le modèle local ont à ce moment-là un coût négligeable : celui de l’énergie que consomme l’équipement pour pouvoir les générer. Il y a aussi le facteur confidentialité, car les conversations que vous avez avec les modèles locaux restent sur votre machine, c’est donc un net avantage lorsque vous travaillez avec des données sensibles, par exemple. Mais il existe un autre coût caché et très important dont Microsoft n’a pas parlé.
Mais gratuitement, rien
Le problème avec le discours de Microsoft est que les jetons gratuits ne sont pas gratuits du tout, car pour utiliser des modèles d’IA locaux, vous avez besoin d’un PC capable de les gérer facilement, et ces PC, surtout aujourd’hui, ne sont pas particulièrement bon marché.

Le nouveau Microsoft Surface Laptop Ultra
Nous en avons l’exemple parfait dans le nouveau Microsoft Surface Laptop Ultra, un fantastique ultraportable basé sur les nouvelles puces Nvidia RTX Spark. Ces ordinateurs sont une excellente option pour pouvoir utiliser ces modèles d’IA locaux, mais pour pouvoir le faire, nous devrons débourser au moins 2 599 $.
Ce prix s’applique également au modèle de base, qui ne dispose que de 24 Go de « mémoire unifiée » LPDDR5x (Microsoft a copié le nom d’Apple). Et ces 24 Go sont précisément en deçà des modèles locaux comme le populaire Qwen3.8-27B, probablement le meilleur « petit » modèle en termes de rapport taille/performance.
En fait, pour pouvoir utiliser ce modèle avec une certaine facilité, il est conseillé de passer à la version du Surface Laptop Ultra avec 32 Go de mémoire unifiée, qui monte jusqu’à 3 299 $. Nous ne disposons pas de données pour le moment sur la bande passante de cette mémoire (Microsoft ne l’indique pas dans les spécifications techniques de l’équipement), mais ce sera un détail plus qu’intéressant.

Le MacBook Pro basé sur M5 Pro avec 48 Go de mémoire unifiée est au même prix que le Surface Laptop Ultra de 32 Go. Nous devrons voir lequel fonctionne le mieux avec les modèles d’IA locaux.
Car pour 3 299 $, nous pouvons acheter un MacBook Pro avec un M5 Pro avec 48 Go de mémoire unifiée et une bande passante de 307 Go/s. C’est une machine tout aussi attrayante pour pouvoir utiliser des modèles d’IA locaux, même si dans la proposition de Microsoft, le support natif CUDA offert par les remarquables puces RTX Spark continue de peser.

Il sera intéressant de comparer les performances des deux machines lors de l’utilisation de modèles d’IA locaux, mais quoi qu’il en soit, une chose est claire : ces « jetons gratuits » dont parle Microsoft ne sont pas gratuits du tout, car vous devez investir 2 599 $ (ou probablement plus) dans une machine qui vous donne accès à cette possibilité.
Et 2 599 $, cela représente de nombreux mois d’abonnement aux forfaits actuels de ChatGPT Plus (20 $) ou Claude Pro (20 $ également), ou d’autres plateformes comparables. Ces forfaits donnent bien sûr accès aux modèles Frontier les plus avancés du marché, mais il est également vrai qu’ils ne vous donnent pas de « jetons infinis ».
Il y a des frais d’utilisation (dans ces deux cas, un
Et pourtant, l’intelligence hybride gagne et convainc
Cette critique de la façon dont l’idée d’intelligence hybride nous est vendue repose uniquement sur cette erreur des jetons gratuits utilisée par Microsoft. Bien sûr, ils ne sont pas gratuits, car même si vous disposez de jetons illimités, cette intelligence locale n’est pas aussi bonne que celle du cloud et nécessite également un investissement initial important.
Mais la vérité est que l’idée de l’intelligence hybride (que nous voulions l’appeler ainsi ou non) est encore très puissante pour l’avenir, et il est plus que probable qu’elle deviendra la manière standard de travailler avec l’IA, non seulement sur PC, mais sur d’autres appareils.
Nous le voyons dans les téléphones mobiles, qui intègrent de petits modèles locaux pour résoudre certaines tâches, mais qui nous permettent également d’accéder à des modèles frontières dans le cloud. Siri AI et Gemini fonctionnent de cette manière, et ils le font de manière de plus en plus transparente pour l’utilisateur.
La même chose se produit avec le PC et les autres appareils : si vous disposez d’un ordinateur relativement puissant dans lequel vous avez déjà fait un investissement important – un GPU avec au moins 16 Go de mémoire graphique aide beaucoup – vous pourrez utiliser des modèles d’IA locaux notables à une vitesse plus que décente.
Combiner ces modèles avec des consultations sur des modèles frontières, que vous payiez ou non un abonnement à OpenAI, Anthropic ou tout autre rival, est une évidence pour l’avenir. L’idée est simple : des modèles plus ou moins chers dans le cloud pour des tâches plus ou moins complexes, et des modèles « gratuits » (avec de nombreuses citations) en local pour d’autres tâches plus routinières et simples.

Compte tenu de l’évolution frénétique de l’IA, cet avenir mixte a encore plus de sens : les modèles ouverts sont de plus en plus puissants et efficaces, et l’évolution du matériel va en parallèle et fait que nos PC et téléphones mobiles nous donnent de plus en plus d’« intelligence » pour moins d’argent.
Cette idée me rappelle une autre que nous avons déjà vécue : dans les premières années d’Internet, où tout était dominé par les modems, les bips, les sites Web grossiers et merveilleux et les vitesses de connexion terribles, les utilisateurs payaient à la minute de connexion.
Nous avons fait ce dont nous avions besoin et avons rapidement mis fin à l’appel, cela ne nous a donc pas coûté cher. Puis le haut débit et les tarifs forfaitaires sont arrivés et nous avons pu profiter d’un accès Internet illimité : vous payiez (et payiez) un abonnement mensuel, et tout l’Internet était à votre portée à tout moment et en tout lieu.
Avec l’IA, exactement la même chose peut se produire. Aujourd’hui, nous payons pour les jetons, nous les utilisons donc lorsque nous en avons besoin et « raccrochons » rapidement cet appel lorsque nous cessons de le faire. Les plans d’abonnement actuels constituent un premier pas vers ce « forfait IA » qui pourrait un jour arriver, mais c’est précisément là que les modèles locaux d’IA et de PC refont surface.
Du coup, vous avez une IA forfaitaire, locale, privée et « assez intelligente ».
Et c’est merveilleux… si l’on suppose que le coût initial sera élevé. Mais en tant qu’idée, bien sûr, c’est très puissant. Nadella a probablement raison. Il ne sera pas le seul à profiter de cette idée (Apple nous a récemment vendu le même concept avec ses nouveaux Mac), mais l’intelligence hybride est là pour rester.
Images | Microsoft
À Simseo | Meta veut tenir tête à OpenAI et Google avec une arme bien particulière : une IA puissante qui fonctionne hors ligne sur votre ordinateur
