Ce qui a changé depuis avril 2026
- LLM — Claude Opus 4.6, GPT-5.4 et Grok 4.20 remplacés par Claude Opus 5 (24 juillet), Claude Fable 5 (9 juin), GPT-5.6 (9 juillet) et Grok 4.5 (8 juillet).
- Code — Claude Opus 4.6 (80,8 % SWE-bench en avril) dépassé : Claude Fable 5 atteint 95 % sur SWE-bench Verified, Claude Opus 5 prend le #1 WebDev Arena.
- Image — GPT Image 1.5, Midjourney V8 et FLUX 2 dépassés par GPT Image 2 (21 avril).
- Vidéo — Seedance 2.0 et Kling 3.0 détrônés par Gemini Omni Flash (19 mai). Sora 2 est en fin de vie (API arrêtée le 24 septembre 2026).
- Open source — Muse Spark n'est pas open source (modèle propriétaire Meta) : retiré de la catégorie. Nouveaux leaders : Kimi K3 (Moonshot, 27 juillet) et GLM-5.2 (Z.ai, 13 juin).
1. Meilleurs LLM (texte et raisonnement)
Claude Opus 5
Anthropic24 juillet 2026 · $5 / $25 par million de tokens
C'est aujourd'hui le meilleur choix « tout terrain » : rédaction longue, analyse de documents, stratégie, et surtout du code. Si vous ne devez en garder qu'une pour le travail intellectuel quotidien, c'est celle-ci. Elle arrive en tête de l'indice Artificial Analysis (61/176 modèles) et domine aussi les classements de développement web.
#1 Artificial Analysis Intelligence Index (61). Contexte 1 million de tokens.
- AA Index
- 61
- GPQA
- ~93,4 %
- HLE
- 52,6 %
- Contexte
- 1M
Points forts
- Meilleur score global Intelligence Index
- Excellent en code et raisonnement long
Points faibles
- Réponses parfois trop longues (verbosité)
Claude Fable 5
Anthropic9 juin 2026 · $10 / $50 par million de tokens
Fable 5 est le modèle préféré des tests « humains en aveugle » (LM Arena, 1508,6 Elo). Il brille sur les tâches très dures — Humanity's Last Exam, et surtout le code de production (95 % sur SWE-bench Verified). À privilégier pour les chantiers complexes, moins pour le quotidien (il est cher).
#1 LM Arena texte. #1 Humanity's Last Exam (53,3 %).
- LM Arena Elo
- 1508,6
- HLE
- 53,3 %
- SWE-bench
- 95 %
- Contexte
- 1M
Points forts
- Leader des votes humains LM Arena
- Record SWE-bench Verified
Points faibles
- Prix d'entrée/sortie élevé
Premier modèle frontière suspendu puis réactivé par un régulateur US (contrôle des exportations, 12 juin → 1er juillet 2026).
GPT-5.6 Sol
OpenAI9 juillet 2026 · modèle par défaut de ChatGPT · $5 / $30
C'est l'IA que la plupart des gens rencontrent dans ChatGPT. Sol mène les benchmarks de maths et de raisonnement (LiveBench, ARC-AGI-2). Idéal si vous voulez rester dans l'écosystème OpenAI (ChatGPT, Codex, plugins) sans jongler entre outils.
AA Index 59. #1 LiveBench Mathematics & Reasoning, #1 ARC-AGI-2.
- AA Index
- 59
- GPQA
- ~94-95 %
- HLE
- 47,2 %
- ARC-AGI-2
- #1
Points forts
- Intégré à ChatGPT et Codex
- Tiers tarifaires Luna / Terra pour baisser la facture
Points faibles
- Moins dominant que Claude sur LM Arena texte
Gemini 3.1 Pro
GoogleInchangé depuis avril · repositionné « précision » · contexte 2M
Gemini reste imbattable quand il faut une fenêtre de contexte énorme (2 millions de tokens) ou croiser des infos avec Google Search. Moins « à la mode » qu'en avril, mais toujours le meilleur pour les dossiers volumineux et les questions scientifiques précises (GPQA Diamond ~95,5 %).
#1 GPQA Diamond (~95,5 %), 98 % ARC-AGI-1, grounding Google Search.
- GPQA
- ~95,5 %
- ARC-AGI-1
- 98 %
- Contexte
- 2M
Points forts
- Contexte géant
- Précision scientifique + Search
Points faibles
- Moins présent dans les tops agentiques 2026
Grok 4.5
xAI8 juillet 2026 · $2 / $6 par million de tokens
Grok 4.5 est le modèle frontière le moins cher du peloton, et le plus fort pour enchaîner des outils (agents). Si vous construisez des automatisations ou codez avec Cursor, c'est un excellent rapport qualité/prix. Attention : xAI ne publie pas encore ses scores GPQA/HLE.
AA Index 54. #1 usage d'outils agentiques. Contexte 500K.
- AA Index
- 54
- Outils
- #1
- Contexte
- 500K
- Prix
- $2 / $6
Points forts
- Prix bas pour un modèle frontière
- Très bon en agentique
Points faibles
- Benchmarks scientifiques non publiés par xAI
| Modèle | Sortie | Elo LM Arena | AA Index | GPQA | HLE | Contexte | Prix in/out |
|---|---|---|---|---|---|---|---|
| Claude Opus 5 | 24 juil. 2026 | — | 61 | ~93,4 % | 52,6 % | 1M | $5 / $25 |
| Claude Fable 5 | 9 juin 2026 | 1508,6 | — | — | 53,3 % | 1M | $10 / $50 |
| GPT-5.6 Sol | 9 juil. 2026 | — | 59 | ~94-95 % | 47,2 % | — | $5 / $30 |
| Gemini 3.1 Pro | avril 2026* | — | — | ~95,5 % | — | 2M | selon Google |
| Grok 4.5 | 8 juil. 2026 | — | 54 | n.p. | n.p. | 500K | $2 / $6 |
* Gemini 3.1 Pro inchangé depuis avril 2026, repositionné « précision ».
2. Meilleurs modèles pour le code
Claude Opus 5
AnthropicModèle par défaut de Claude Code
Pour coder au quotidien (sites, apps, scripts), Opus 5 est le nouveau standard : #1 WebDev Arena (1702,9 Elo) et très haut sur SWE-bench. C'est celui que Claude Code utilise par défaut — le bon réflexe pour la plupart des développeurs.
#1 WebDev Arena (1702,9). SWE-bench ~96-97 %.
- WebDev Arena
- 1702,9
- SWE-bench
- ~96-97 %
- image→Web
- 1668,6
Points forts
- Meilleur modèle code généraliste août 2026
Points faibles
- Coût élevé en gros volume
Claude Fable 5
AnthropicRecord SWE-bench Verified
Quand le chantier est long (refacto massive, agent qui travaille des heures), Fable 5 garde le record SWE-bench Verified à 95 %. Moins utile pour les petits tickets ; précieux pour les missions critiques.
#1 SWE-bench Verified (95 %). #1 SWE-bench Pro (80,3 %).
- SWE-bench Verified
- 95 %
- SWE-bench Pro
- 80,3 %
Points forts
- Tâches longues / agents
Points faibles
- Tarif élevé ($10 / $50)
GPT-5.6 Sol
OpenAIModèle par défaut de Codex
Si vous travaillez dans le terminal ou avec Codex, Sol mène Terminal-Bench 2.1 (89,5 %). Moins fort qu'Opus sur le pure Web, excellent pour l'outillage ligne de commande et l'écosystème OpenAI.
#1 Terminal-Bench 2.1 (89,5 %).
- Terminal-Bench
- 89,5 %
Points forts
- Terminal / tooling OpenAI
Points faibles
- Moins fort que Claude sur WebDev Arena
Kimi K3
Moonshot AIOpen-weight
Meilleur modèle open-weight pour le code : #2 WebDev Arena juste derrière Opus 5. Intéressant si vous voulez des poids ouverts sans sacrifier trop de performance — à condition d'avoir l'infra pour le faire tourner.
#2 WebDev Arena (1675,5). SWE-bench ~93,4 %.
- WebDev Arena
- 1675,5
- SWE-bench
- ~93,4 %
Points forts
- Meilleur open-weight code
Points faibles
- Déploiement lourd
En pratique : Copilot propose Opus 5, Sonnet 5, GPT-5.6, Gemini 3.1 Pro et Fable 5. Grok 4.5 est co-entraîné sur les données Cursor. Pour le quotidien économique, Claude Sonnet 5 ($2/$10 en promo jusqu'au 31 août) reste très viable.
| Modèle | SWE-bench Verified | WebDev Arena Elo | Terminal-Bench | Prix |
|---|---|---|---|---|
| Claude Opus 5 | ~96-97 % | 1702,9 | — | $5 / $25 |
| Claude Fable 5 | 95 % | — | — | $10 / $50 |
| GPT-5.6 Sol | — | — | 89,5 % | $5 / $30 |
| Kimi K3 | ~93,4 % | 1675,5 | — | $3 / $15 |
3. Génération d'images
GPT Image 2
OpenAI21 avril 2026 · inclus ChatGPT Plus / Pro
Pour générer ou éditer des images, GPT Image 2 écrase le classement (1339 Elo Artificial Analysis, écart record). Texte dans l'image quasi parfait, y compris en français. Le choix par défaut si vous êtes déjà sur ChatGPT.
#1 Text-to-Image AA (1339 Elo). #1 édition d'image (1258).
- Elo AA
- 1339
- Édition
- 1258
Points forts
- Écart le plus large jamais mesuré
- Rendu de texte multilingue
Points faibles
- Surtout via ChatGPT / API OpenAI
- Reve 2.1 — #2 AA (1299), modèle 4K « layout-first » (9 juillet) — utile pour les maquettes propres.
- MAI-Image-2.5 — Microsoft, #3 AA (1270) — intéressant dans l'écosystème Microsoft 365.
- Nano Banana 2 — Google — le meilleur choix gratuit (~1263 Elo).
- Midjourney V8.1 — Toujours la référence esthétique/artistique, mais pas d'API publique ni d'offre gratuite (litige copyright en cours).
- FLUX.2 — Meilleur open-weight image si vous auto-hébergez.
| Modèle | Elo AA | Points forts | Accès / prix |
|---|---|---|---|
| GPT Image 2 | 1339 | Texte, édition | ChatGPT Plus/Pro + API |
| Reve 2.1 | 1299 | 4K layout-first | API Reve |
| MAI-Image-2.5 | 1270 | Écosystème Microsoft | selon Microsoft |
| Nano Banana 2 | ~1263 | Meilleur gratuit | Gratuit (Google) |
| Midjourney V8.1 | — | Esthétique artistique | Abonnement MJ |
| FLUX.2 | — | Open-weight | Auto-hébergement |
4. Génération de vidéos
Gemini Omni Flash
Google19 mai 2026 · $0,10/s ($6/min)
Pour des clips courts avec son synchronisé, Omni Flash est #1 des deux classements vidéo (1527 Elo LM Arena, 45 points d'avance). Idéal pour des pubs courtes, des démos produit ou du social. Pas pour le long format : là, passez à Veo 3.1.
#1 Text-to-Video LM Arena (1527). Clips 10 s, audio sync, édition conversationnelle.
- Elo
- 1527
- Durée
- 10 s
- Audio
- Sync
- Prix
- $0,10/s
Points forts
- Leader des boards vidéo août 2026
Points faibles
- Clips courts (environ 10 s)
- MiniMax H3 / Hailuo 3.0 — 31 juillet — #2 AA (1241,5), clips 2K 4-15 s avec audio stéréo ($0,13/s).
- Seedance 2.0 — ByteDance — toujours en tête de l'image-to-video avec audio (1196 Elo AA).
- Kling 3.0 — Kuaishou — meilleur choix « achetable » hors Google (1080p, 15 s).
| Modèle | Elo | Durée / résolution | Audio | Prix/s |
|---|---|---|---|---|
| Gemini Omni Flash | 1527 | 10 s | Oui | $0,10 |
| MiniMax H3 | 1241,5 AA | 2K · 4-15 s | Stéréo | $0,13 |
| Seedance 2.0 | 1196 (i2v) | selon ByteDance | Oui | selon éditeur |
| Kling 3.0 | — | 1080p · 15 s | selon offre | selon Kuaishou |
| Veo 3.1 | — | 4K · 60 s+ | Oui | production longue |
5. Open source et outsiders
Kimi K3
Moonshot AIPoids ouverts 27 juillet 2026 · $3 / $15
Kimi K3 est le plus grand open-weight jamais publié (2,8 mille milliards de paramètres) et le meilleur open-weight d'août (AA Index 57, #3 tous modèles confondus). À choisir si vous voulez des poids ouverts au niveau frontière — mais il faut une grosse infra (≥64 accélérateurs recommandés).
2,8T paramètres (104B actifs). AA Index 57. Contexte 1M. Vision native.
- Params
- 2,8T
- AA Index
- 57
- Contexte
- 1M
Points forts
- Meilleur open-weight août 2026
- Niveau frontière
Points faibles
- Infra très lourde
GLM-5.2
Z.ai13 juin 2026 · licence MIT
Si vous voulez de l'open-weight sans cluster monstrueux, GLM-5.2 est le meilleur mono-nœud (licence MIT, ~168 tokens/s, AA Index 51). Le choix réaliste pour une PME qui auto-héberge.
744B (~40B actifs). AA Index 51. #1 Design Arena code.
- AA Index
- 51
- Vitesse
- ~168 tok/s
- Licence
- MIT
Points forts
- Mono-nœud réaliste
- Licence MIT
Points faibles
- Moins fort que Kimi K3 en score brut
DeepSeek V4-Flash
DeepSeek31 juillet 2026 · licence MIT · $0,14 / $0,28
Le champion du rapport prix/performance : AA Index 50 pour une fraction du coût des modèles frontière (~$0,03 par tâche d'index). Parfait pour du volume (support, classification, premiers jets) quand le budget prime.
AA Index 50. Meilleur prix/perf du marché.
- AA Index
- 50
- Prix in/out
- $0,14 / $0,28
Points forts
- Budget / scale
Points faibles
- Moins capable qu'Opus ou Kimi
À noter aussi : Qwen 3.6/3.7 Max (Alibaba), Inkling (Thinking Machines, Apache 2.0 — meilleur open-weight US), Mistral pour l'entreprise UE. Llama 5 (Meta) n'est plus compétitif. Muse Spark est propriétaire : ce n'est plus un choix « ouvert ».
Ces modèles changent aussi la façon dont vos clients vous trouvent : être cité par les IA (GEO) devient un levier de visibilité à part entière, aux côtés d'une agence SEO.
Récapitulatif — le top 10 d'août 2026
| Rang | Modèle | Éditeur | Catégorie | Pourquoi | Prix |
|---|---|---|---|---|---|
| #1 | Claude Opus 5 | Anthropic | LLM / Code | #1 AA Index, #1 WebDev Arena | $5 / $25 |
| #2 | Claude Fable 5 | Anthropic | LLM / Code | #1 LM Arena texte, SWE-bench 95 % | $10 / $50 |
| #3 | GPT-5.6 Sol | OpenAI | LLM | #1 LiveBench Math, défaut ChatGPT | $5 / $30 |
| #4 | Gemini 3.1 Pro | LLM | Leader GPQA, contexte 2M | selon Google | |
| #5 | GPT Image 2 | OpenAI | Image | #1 génération d'images (1339 Elo) | ChatGPT Plus/Pro |
| #6 | Gemini Omni Flash | Vidéo | #1 vidéo (1527 Elo), audio sync | $0,10/s | |
| #7 | Grok 4.5 | xAI | LLM / Agentique | Meilleur coût/agentique | $2 / $6 |
| #8 | Kimi K3 | Moonshot AI | Open-weight | Meilleur open-weight, 2,8T params | $3 / $15 |
| #9 | GLM-5.2 | Z.ai | Open-weight | Meilleur mono-nœud, MIT | auto-hébergement |
| #10 | DeepSeek V4-Flash | DeepSeek | Open-weight | Meilleur prix/performance | $0,14 / $0,28 |
Comment choisir la bonne IA en août 2026 ?
Usage général
Claude Opus 5 ou GPT-5.6 Sol — selon que vous préférez Anthropic ou l'écosystème ChatGPT.
Code
Opus 5 au quotidien, Fable 5 pour les gros chantiers, Sonnet 5 si le budget compte.
Images
GPT Image 2. En gratuit : Nano Banana 2 (Google).
Vidéo
Gemini Omni Flash pour le court. Veo 3.1 pour le long format.
Auto-hébergement
GLM-5.2 (un nœud) ou DeepSeek V4-Flash (budget). Kimi K3 si vous avez l'infra.
Budget serré
Grok 4.5 (API) ou DeepSeek V4-Flash (volume).
Questions fréquentes
Méthodologie et sources
Sources : LM Arena / Arena.ai (arrêt des votes au 1er août 2026), Artificial Analysis (Intelligence Index v4.1), SWE-bench, annonces officielles des éditeurs. Les Elo sont des instantanés. Certains chiffres (Grok 4.5, DeepSeek, Kimi K3) viennent des éditeurs et ne sont pas tous répliqués indépendamment. Page mise à jour chaque mois.
Besoin d'un site qui convertit vraiment ?
Les meilleurs modèles accélèrent la production de contenus — encore faut-il un site lisible et un SEO local solide. Notre analyse SEO gratuite fait l'état des lieux en 24h.

