Un rapport de la fondation Mozilla sur l’intelligence artificielle ouverte, et un chiffre qui retient l’attention. Cela ne veut pas dire que les modèles ouverts égalent les américains partout. Cela veut dire que sur la plupart des tâches d’une journée de travail, l’écart ne se voit plus, alors que la facture, elle, se voit tout de suite.
C’est quoi, concrètement, un modèle ouvert ?
C’est un modèle dont les poids sont téléchargeables : n’importe qui peut le faire tourner sur ses propres machines, ou le confier à un hébergeur. Le vocabulaire mérite une précision que le rapport souligne : ouvert ne signifie pas open source au sens strict. Sur les 16 sorties notables recensées, aucune ne publie la recette complète des données d’entraînement. Vous obtenez le moteur, pas les plans de l’usine. La différence pratique, pour une entreprise, est ailleurs : vous n’êtes plus obligé de passer par l’abonnement d’un éditeur unique pour accéder à une intelligence artificielle de bon niveau.
Quel est l’écart de performance, et pour quel prix ?
Sur l’indice d’Artificial Analysis, une note composite de neuf épreuves, le meilleur modèle ouvert obtient 60 points. Kimi K3, du laboratoire Moonshot AI, n’est qu’à 3 points du leader fermé Claude Opus 5, qui en totalise 63. Face à Claude Fable 5, l’écart tombe à 2 points, et Kimi K3 se facture un peu moins d’un tiers du tarif de Claude Fable 5. Les tarifs publics le confirment : 3 dollars le million de tokens en entrée et 15 en sortie pour Kimi K3, contre 10 et 50 pour Claude Fable 5. Quatre des dix meilleurs modèles du classement sont ouverts.
Et depuis le rapport, qu’est-ce qui a bougé ?
Trois jours après la publication du rapport, la tête du classement a changé. Le 22 septembre 2026, Xiaomi a publié en accès libre sa série MiMo-V2.6, dont le modèle Pro obtient 46,32 sur l’indice Intelligence d’Artificial Analysis. Il devient le premier modèle à poids ouverts du classement, devant GLM-5.3 et Kimi K3, et se place au niveau du modèle fermé Grok 4.7. La licence MIT autorise l’usage commercial sans contrepartie. Les tarifs de l’API restent ceux de la génération précédente : 0,435 dollar le million de jetons en entrée et 0,87 en sortie pour Pro, et 0,14 et 0,28 pour Flash, la version légère. Une précaution de lecture s’impose : Artificial Analysis a revu son indice entre-temps, et ces notes ne se comparent donc pas à celles que cite le rapport Mozilla. Ce qui se compare, en revanche, c’est le rapport entre qualité et prix, et il continue de pencher du côté des modèles ouverts.
Combien ça coûte réellement, à l’usage ?
Le prix au million de tokens ne dit pas tout, parce qu’un modèle bavard consomme davantage. Les mesures par tâche terminée sont plus parlantes : 0,86 dollar pour Kimi K3, 2,03 dollars pour Claude Opus 5, 3,15 dollars pour Claude Fable 5. La règle que le rapport en tire est simple : payer le haut de gamme achète environ quatre mois d’avance, à environ cinq fois le coût par tâche. Sur le test Terminal-Bench 2.1, mené avec le même harnais pour tous les modèles, GLM-5.2 de Z.ai (Zhipu AI) arrive à un point de Claude Opus 4.7 pour moins d’un cinquième du coût. Un bémol honnête : une partie de l’écart se rattrape dans le volume de texte produit, et DeepSeek a relevé ses tarifs le 16 août 2026. Les prix les plus bas ne sont pas acquis.
Est-ce que ça suffit pour les tâches d’une TPE ?
C’est la question qui compte vraiment. Le rapport répond avec une mesure de temps de travail : en dessous de 8 heures de travail humain, les deux familles de modèles font le travail. Au-delà de 12 heures, aucune des deux n’y arrive de façon fiable. Entre les deux se trouve une bande étroite, et cette bande se déplace, puisque ce que le haut de gamme réussit aujourd’hui, l’ouvert le réussit environ quatre mois plus tard. Pour un artisan ou un commerce d’Auxerre, une facture, un devis, une réponse à un avis, un compte rendu de réunion ou une fiche produit n’approchent jamais les 8 heures. Sur ces tâches, payer le tarif de pointe n’apporte rien de visible.
Pourquoi payer encore le haut de gamme, alors ?
Il reste une bande de tâches où le paiement se justifie, et le rapport la nomme clairement : les chantiers de 8 à 12 heures, et tout ce qui porte une échéance. Développer une application, analyser un dossier lourd, chercher la cause d’un bug récalcitrant, tenir une longue chaîne de raisonnement sans perdre le fil. L’argument n’est pas la puissance brute, c’est le temps gagné. Le rapport ajoute un point que les tests ne montrent pas : les modèles fermés arrivent prêts à l’emploi, avec la conformité, le support et la responsabilité qui vont avec. Beaucoup d’entreprises paient cela, plus que les points de performance.
Où est le piège ?
Le premier point de vigilance est le passage de l’essai à la production. Dans l’enquête menée auprès de 1 410 développeurs, celles et ceux qui ont abandonné l’IA ouverte citent la maintenance, l’intégration aux outils existants et une qualité insuffisante, alors que le coût ne les distingue pas de ceux qui continuent. Le second est la fraîcheur des chiffres : le rapport s’arrête au 1er septembre 2026, et la sortie de MiMo-V2.6 trois semaines plus tard montre à quelle vitesse la tête du classement change. Le rapport l’écrit lui-même, l’écart se réinitialise à chaque cycle au lieu de se creuser.
Pour un dirigeant de TPE, la conclusion tient en une phrase : le modèle le plus puissant du marché n’est pas le bon outil par défaut. Réglez votre assistant sur un modèle économique pour les tâches courantes, et gardez le haut de gamme pour les chantiers longs qui ont une date. C’est le choix que nous appliquons chez DSR pour nos clients de l’Yonne comme ailleurs : le bon modèle au bon endroit, pas le plus cher partout.