Kimi K3, que beaucoup cherchent sous le nom « Kimi 3.0 », est le nouveau modèle de Moonshot AI sorti le 16 juillet 2026 : 2 800 milliards de paramètres, un contexte de 1 million de tokens et une API à 3 dollars le million de tokens en entrée. Face à lui, Claude Fable 5 d’Anthropic conserve la première place sur les performances globales, et GPT-5.6 Sol reste la référence sur certaines tâches agentiques. Mais K3 prend la tête sur plusieurs benchmarks de code et de navigation web, pour un tarif nettement plus agressif. Voici le comparatif complet, chiffres sourcés à l’appui, et notre verdict selon votre usage.

Kimi K3, Claude Fable 5, GPT-5.6 Sol : les forces en présence

Trois modèles, trois philosophies. Moonshot AI joue la carte du gigantisme ouvert : Kimi K3 est un Mixture of Experts de 2 800 milliards de paramètres, dont 16 experts actifs sur 896 à chaque requête, avec une promesse forte : la publication des poids d’ici au 27 juillet 2026. Anthropic défend le sommet du classement avec Claude Fable 5, son modèle le plus avancé, propriétaire et accessible uniquement par API et applications. OpenAI aligne GPT-5.6 Sol, pilier de son offre agentique.

Le tableau ci-dessous résume les caractéristiques confirmées au 22 juillet 2026 :

Caractéristique Kimi K3 Claude Fable 5 GPT-5.6 Sol
Éditeur Moonshot AI (Chine) Anthropic (États-Unis) OpenAI (États-Unis)
Sortie 16 juillet 2026 2026 2026
Architecture MoE 2 800 milliards de paramètres, Kimi Delta Attention Propriétaire, non détaillée Propriétaire, non détaillée
Contexte 1 048 576 tokens Contexte long (API) Contexte long (API)
Poids ouverts Annoncés pour le 27 juillet 2026 Non Non
Prix API entrée / sortie 3 $ / 15 $ par million de tokens Voir tarifs Anthropic Voir tarifs OpenAI

Un point d’honnêteté d’entrée de jeu : Moonshot AI reconnaît lui-même, dans son annonce officielle, que Kimi K3 reste globalement derrière Claude Fable 5 et GPT-5.6 Sol. C’est rare, et cela rend le reste de ses chiffres d’autant plus crédibles. Pour le contexte complet du lancement, lisez notre article dédié : Kimi K3, le plus grand modèle IA open source au monde.

Benchmarks : qui gagne quoi, chiffres en main

Sur les évaluations indépendantes publiées depuis le lancement, Kimi K3 signe plusieurs premières places qui expliquent le bruit ambiant :

  • BrowseComp (navigation web agentique) : 91,2 %, meilleur score publié à ce jour.
  • DeepSWE 1.0 (résolution de tickets logiciels) : 67,5 %, première place.
  • Next.js Evals : 92 %, première place sur la génération d’applications web.
  • Arena Elo Code : 1679, en tête du classement code au moment de la mesure.
  • GPQA Diamond (raisonnement scientifique) : 93,5 %.
  • Terminal-Bench 2.1 : 88,3 %, deuxième place derrière GPT-5.6 Sol.

En face, Claude Fable 5 conserve l’avantage sur les évaluations généralistes : l’agrégateur Artificial Analysis classe Kimi K3 quatrième sur 189 modèles, derrière les meilleurs modèles propriétaires, et l’arène texte le place sixième. Sur la génération d’interfaces web, en revanche, une arène communautaire le donne premier, devant Claude Fable 5.

Prudence toutefois : une partie des scores mis en avant par Moonshot, notamment ses premières places revendiquées sur les benchmarks agentiques, sont auto-rapportés et non audités. Les chiffres cités ci-dessus proviennent d’agrégateurs tiers, mais la période est jeune et les classements bougent chaque semaine, comme nous l’expliquions déjà dans notre comparatif DeepSeek V3 contre Claude Sonnet.

Prix API : l’argument massue de Moonshot

La grille tarifaire officielle de Kimi K3 est simple et agressive :

  • 3 dollars par million de tokens en entrée
  • 15 dollars par million de tokens en sortie
  • 0,30 dollar par million de tokens en cache hit

Des sites tiers avancent que K3 reviendrait moitié moins cher que ses concurrents directs par tâche accomplie : cette extrapolation n’a rien d’officiel, retenez surtout que le positionnement prix est clairement pensé pour attaquer les modèles frontière américains sur leur terrain.

Attention cependant au coût réel : le mode raisonnement de K3 est toujours actif, avec un paramètre reasoning_effort réglé sur max par défaut au lancement. Concrètement, une requête simple peut consommer plusieurs milliers de tokens de raisonnement avant même de produire la réponse. Pour un usage économique, pensez à repasser ce paramètre sur low ou high selon la tâche.

Contexte 1 million de tokens et architecture KDA : ce que ça change

La fenêtre de contexte de 1 048 576 tokens place Kimi K3 dans le club très fermé des modèles capables d’avaler des bases de code entières, des rapports de centaines de pages ou de longues sessions agentiques sans perdre le fil. C’est le fruit d’une architecture originale : Kimi Delta Attention, complétée par des résidus d’attention, réduit drastiquement le coût mémoire des longues séquences, tandis que l’entraînement en précision réduite (poids MXFP4) allège l’inférence.

Moonshot a d’ailleurs publié les kernels de cette attention sous licence MIT dans un dépôt dédié, un signal d’ouverture technique qui tranche avec l’opacité des laboratoires américains sur leurs architectures. Claude Fable 5 et GPT-5.6 Sol offrent aussi des contextes longs, mais leurs mécanismes internes ne sont pas documentés publiquement.

Pour les développeurs, la conséquence est directe : des agents qui tiennent des sessions de travail beaucoup plus longues. Les démonstrations mises en avant par Moonshot vont dans ce sens : un compilateur écrit de zéro sur plusieurs jours de session, une puce simple conçue en 48 heures, une petite recherche de physique menée en deux heures. Des vitrines choisies par l’éditeur, à prendre comme telles, mais cohérentes avec ce que permet un contexte de cette taille.

Code et agents : le terrain où Kimi K3 frappe fort

Le message le plus étonnant du lancement se trouve dans un domaine pointu : l’optimisation de kernels GPU, où Moonshot revendique de meilleurs résultats que Claude Opus 4.8 et que les modèles OpenAI récents. Ajoutez les premières places sur DeepSWE et Next.js Evals, et une tendance se dessine : K3 vise clairement les développeurs et les workflows agentiques.

Voici comment tester le modèle via son API, compatible avec le format OpenAI :

curl https://api.moonshot.ai/v1/chat/completions 
  -H "Content-Type: application/json" 
  -H "Authorization: Bearer $MOONSHOT_API_KEY" 
  -d '{
    "model": "kimi-k3",
    "reasoning_effort": "low",
    "messages": [
      {"role": "user", "content": "Optimise cette fonction Python : ..."}
    ]
  }'

Côté outils, Moonshot fournit Kimi Code, son agent en ligne de commande, ainsi que des applications de bureau et mobiles. Un bémol documenté : l’outil de recherche web intégré à l’API est signalé « en cours de mise à jour » par l’éditeur lui-même, qui déconseille de s’y fier pour le moment. Si vous travaillez déjà avec l’écosystème Anthropic, notre guide de l’API Claude pour développeurs reste le point de comparaison le plus direct.

Open source ou pas ? Le rendez-vous du 27 juillet

C’est LA question qui entretient le suspense. Moonshot promet la publication des poids de Kimi K3 d’ici au 27 juillet 2026. Au 22 juillet, vérification faite, rien n’est encore en ligne : l’organisation Hugging Face de Moonshot ne liste aucun modèle K3, et aucun dépôt de poids n’existe sur son GitHub officiel. La licence exacte n’est pas connue non plus : des sites tiers évoquent une licence de type MIT modifiée, comme pour Kimi K2, mais rien d’officiel n’a été publié.

Si la promesse est tenue, Kimi K3 deviendra le plus grand modèle à poids ouverts jamais publié, loin devant les précédents records. Avec une nuance de taille : à 2 800 milliards de paramètres, même quantifié, le modèle exige une infrastructure de datacenter, Moonshot recommandant des grappes d’au moins 64 accélérateurs. L’open source, oui, mais pour les organisations équipées. Les enjeux de cette bataille entre modèles ouverts et propriétaires sont détaillés dans notre analyse IA open source contre modèles propriétaires.

Verdict : quel modèle choisir selon votre usage

Notre lecture au 22 juillet 2026, en croisant les benchmarks tiers, les tarifs officiels et les limites documentées :

  • Qualité maximale, fiabilité, production critique : Claude Fable 5 reste la référence, y compris de l’aveu de Moonshot. C’est le choix par défaut quand le coût passe après la qualité.
  • Workflows agentiques en terminal : GPT-5.6 Sol garde la tête sur Terminal-Bench, avec un écosystème d’outils mature.
  • Code, navigation web agentique, gros volumes à petit budget : Kimi K3 est la nouvelle option sérieuse, avec ses premières places sur BrowseComp et DeepSWE et son tarif d’appel.
  • Déploiement souverain sur votre propre infrastructure : attendez le 27 juillet et la publication effective des poids avant de décider quoi que ce soit.

Le vrai signal de ce lancement dépasse le duel de benchmarks : un laboratoire chinois livre un modèle de classe frontière, en assume les limites publiquement et promet d’en ouvrir les poids. La pression sur les prix et sur l’ouverture des laboratoires américains ne fait que commencer.

FAQ : vos questions sur Kimi K3 face à Claude et GPT

Kimi K3 ou Kimi 3.0 : quel est le nom officiel ?

Le nom officiel est Kimi K3, sans « .0 ». C’est l’appellation utilisée par le blog de Moonshot AI, par l’API (identifiant kimi-k3) et par toute la presse spécialisée. « Kimi 3.0 » est une variante de recherche courante mais non officielle.

Kimi K3 est-il vraiment meilleur que Claude Fable 5 ?

Non sur le plan global : Moonshot reconnaît que K3 reste derrière Claude Fable 5 et GPT-5.6 Sol en performance générale. Il prend en revanche la tête sur plusieurs benchmarks spécialisés, notamment la navigation web agentique et certaines évaluations de code.

Combien coûte l’API de Kimi K3 ?

Les tarifs officiels sont de 3 dollars par million de tokens en entrée, 15 dollars en sortie et 0,30 dollar en cache hit. Le mode raisonnement, actif par défaut au niveau maximal, peut cependant augmenter sensiblement la facture réelle par requête.

Les poids de Kimi K3 sont-ils téléchargeables ?

Pas encore au 22 juillet 2026. Moonshot promet leur publication d’ici au 27 juillet 2026. Ni Hugging Face ni GitHub n’hébergent les poids pour le moment, et la licence exacte n’a pas été annoncée.

Peut-on faire tourner Kimi K3 en local ?

Pas sur une machine individuelle : avec 2 800 milliards de paramètres, le modèle vise les infrastructures de datacenter, Moonshot recommandant des grappes d’au moins 64 accélérateurs. Pour un usage personnel, l’API ou les applications officielles restent la seule voie réaliste.

Sources

  1. Moonshot AI : annonce officielle de Kimi K3
  2. Plateforme Kimi : tarifs et documentation API de Kimi K3
  3. Hugging Face : organisation officielle Moonshot AI
  4. CNBC : Moonshot AI défie OpenAI et Anthropic avec Kimi K3
  5. BBC News : le lancement de Kimi K3
  6. AI Release Tracker : benchmarks indépendants de Kimi K3
G
WP Admin Lab

Architecte web full-stack. WordPress, performance, data et sécurité. Notes de terrain, tests reproductibles et retours d'expérience.