Il y a un an, choisir un modèle d'IA signifiait opter pour l'une des trois API fermées et accepter le prix associé. Ce choix par défaut n'est plus automatique. Les versions à poids ouverts de Meta, Mistral, DeepSeek et d'une liste croissante de laboratoires gèrent désormais les tâches de codage, de résumé et de classification à un niveau qui satisfait la plupart des besoins de production. Pour les propriétaires de sites, la question n'est plus de savoir si les modèles à poids ouverts sont assez bons. Il s'agit de déterminer quelles charges de travail justifient encore le paiement d'une API fermée.
Ce que signifie réellement « poids ouvert »
Un modèle à poids ouverts publie ses paramètres entraînés pour que quiconque puisse les télécharger et les exécuter. Cela signifie que les poids du modèle entraîné sont téléchargeables, mais que les données d'entraînement et le code d'entraînement complet ne sont généralement pas publiés, et que la licence peut ajouter des restrictions d'utilisation. Cette distinction est importante car le poids ouvert n'est pas la même chose que l'open source au sens strict.
Les conditions de licence varient considérablement d'un fournisseur à l'autre, ce qui crée un risque réel pour les équipes d'approvisionnement. Certains laboratoires distribuent leurs modèles sous des licences sur mesure comportant des plafonds de production, des clauses d'utilisation éthique ou des exigences de juridiction. Les services d'achat doivent donc lire chaque licence de poids avant de signer, plutôt que de supposer qu'une norme permissive s'applique. Les accords Llama de Meta, par exemple, ajoutent des conditions commerciales spécifiques une fois qu'un produit dépasse un certain seuil d'utilisateurs.
Mistral a emprunté une voie différente avec ses récentes sorties. Mistral Small 4 a été publié en tant que modèle de 119 milliards de paramètres sous une licence permissive Apache 2.0, décrit comme la seule sortie d'un grand laboratoire sans astérisques de licence. Une telle clarté est suffisamment rare pour constituer une nouvelle en soi.

Où en est l'écart de performance maintenant
Le suivi indépendant nous donne des chiffres réels plutôt que les promesses des fournisseurs. Depuis janvier 2026, les modèles à poids ouverts les plus performants ont accusé un retard moyen de quatre mois par rapport aux modèles fermés de pointe dans l'Epoch Capabilities Index, avec un écart moyen de 8 points, similaire à l'écart entre GPT-5 et GPT-5.5. Il s'agit d'une différence mesurable, mais elle est bien moindre que l'avance de plusieurs années dont bénéficiaient autrefois les laboratoires fermés.
L'écart varie également fortement selon le type de tâche. Sur les benchmarks de codage spécifiquement, GLM-5.1 et Kimi K2.6 atteignent environ 58 pour cent sur SWE-Bench Pro, au même niveau qu'un modèle fermé de milieu de gamme comme GPT-5.5, même si les meilleurs codeurs fermés conservent une longueur d'avance. Pour le travail textuel quotidien, la situation semble encore plus favorable aux modèles ouverts. Pour la classification, l'extraction, le résumé, la réponse aux questions basée sur la recherche documentaire et la plupart des tâches de codage, un bon modèle à poids ouverts en 2026 n'est pas un compromis. Il fait le travail.
Là où les modèles fermés conservent un avantage clair, c'est dans le raisonnement complexe en plusieurs étapes. L'avantage résiduel des modèles fermés est réel mais spécifique, et il apparaît dans le raisonnement agentique à long terme, ces tâches qui exécutent vingt, trente étapes dépendantes ou plus, où une erreur initiale doit être détectée et corrigée plutôt que simplement ignorée. Le travail multimodal raconte une histoire similaire. Le multimodal est la catégorie où l'écart entre modèles fermés et ouverts reste le plus large, car le raisonnement unifié texte-image-audio-vidéo nécessite des corpus d'entraînement, une infrastructure et un travail d'alignement que les versions à poids ouverts n'ont pas encore égalés au plus haut niveau.

Le calcul des coûts n'est pas aussi simple qu'il y paraît
Le prix est la raison pour laquelle la plupart des équipes commencent à s'intéresser aux modèles à poids ouverts. Louer un modèle ouvert auprès d'un hébergeur tiers est souvent nettement moins cher qu'une API fermée. Une étude sur les prix catalogue a révélé que l'accès par API à des poids ouverts coûte en moyenne environ $0.23 par million de jetons, contre $1.86 pour les modèles fermés, soit environ huit fois moins cher. Cependant, ce chiffre décrit l'accès hébergé, et non le coût de fonctionnement de votre propre infrastructure.
L'auto-hébergement entraîne des coûts qu'une simple comparaison de prix ignore. L'économie de l'auto-hébergement repose sur l'utilisation, car vous louez des GPU à l'heure, que des requêtes arrivent ou non, et un point de terminaison traitant un trafic irrégulier avec une faible utilisation peut facilement coûter plus cher par jeton qu'une API de pointe. Ajoutez le temps d'ingénierie pour le déploiement et la maintenance, et le calcul change encore. Ajouter le temps d'ingénierie pour le faire fonctionner, incluant le déploiement, la mise à l'échelle, les mises à niveau et la réponse aux incidents, repousse le point de rentabilité au-delà de ce que prévoient la plupart des estimations. Ce calcul est devenu plus difficile en 2026 car la capacité des GPU s'est resserrée et les prix de location ont augmenté plutôt que baissé.
En dessous d'un certain volume, la location auprès d'un fournisseur spécialisé l'emporte sur l'auto-hébergement. En dessous d'environ 100 millions de jetons par mois, les API sans serveur pour poids ouverts battent les installations GPU auto-hébergées en coût total, une fois que la capacité inutilisée, les opérations et la bascule sont prises en compte. La plupart des exploitants de sites de petite et moyenne taille se situent bien en dessous de ce seuil, ce qui simplifie la décision plus que ne le suggère le marketing.
Choisir entre ouvert et fermé pour des projets réels
Les entreprises ne traitent plus cela comme un choix binaire. Des recherches ont montré que les organisations utilisent ou évaluent en moyenne sept modèles, 78 % d'entre elles exploitant une partie de l'inférence elles-mêmes. Le modèle mature est hybride : poids ouverts auto-hébergés pour le travail sensible, à haut volume, nécessitant une faible latence ou hors ligne, et API fermées pour le raisonnement complexe et les cas rares irréguliers, avec une couche de routage décidant par requête. Pour un petit opérateur, une configuration de routage complète est excessive, mais la logique sous-jacente s'applique toujours à plus petite échelle.
Le contrôle des données est souvent le facteur décisif plutôt que la capacité brute. Si un seul prompt quittant votre réseau est inacceptable, pour des dossiers patients, des données financières, des documents classifiés ou un mandat strict de résidence des données, l'auto-hébergement à poids ouverts est généralement la seule option qui satisfait pleinement l'exigence, échangeant la commodité contre un contrôle physique. Si votre site gère des dossiers clients ou du contenu réglementé, cela peut suffire à régler la question avant même que la performance n'entre dans la conversation.
Pour les tâches à haut volume et faible sensibilité, le calcul favorise presque toujours le poids ouvert. Si vous traitez un volume élevé et constant de données non sensibles, telles que la classification, le résumé ou la génération de code à travers des millions de requêtes, la facture par jeton sur un modèle fermé de pointe devient le poste de dépense dominant, ce qui constitue l'argument le plus clair en faveur du poids ouvert. Gardez l'API fermée sous la main pour le problème complexe occasionnel et laissez le modèle moins cher supporter la charge routinière.
Conclusion
Le débat sur les poids ouverts par rapport aux API fermées ne porte plus sur la question de savoir si les modèles ouverts sont assez bons. Il s'agit d'adapter chaque charge de travail au bon outil. Les API fermées gagnent toujours sur les tâches de raisonnement les plus complexes et le travail multimodal complet, mais les modèles à poids ouverts gèrent désormais la plupart des tâches quotidiennes à une fraction du coût. Avant de renouveler un contrat d'API fermée, testez un modèle à poids ouverts sur votre charge de travail réelle pendant une semaine. Vous pourriez découvrir que l'écart compte beaucoup moins que la facture.





