Alizée Web

· Mis à jour le 4 août 2026 · Lecture : 15 min

Top 10 des meilleures IA en août 2026 : classement complet par catégorie

Entre avril et août 2026, le classement a été bouleversé : quatre modèles frontière sont sortis en huit jours mi-juillet. Les leaders d'avril (Gemini 3.1 Pro, Claude Opus 4.6, GPT-5.4, Grok 4.20, Seedance 2.0, GPT Image 1.5) ont presque tous été détrônés.

Top 10 des meilleures IA en août 2026

Ce qui a changé depuis avril 2026

  • LLMClaude Opus 4.6, GPT-5.4 et Grok 4.20 remplacés par Claude Opus 5 (24 juillet), Claude Fable 5 (9 juin), GPT-5.6 (9 juillet) et Grok 4.5 (8 juillet).
  • CodeClaude Opus 4.6 (80,8 % SWE-bench en avril) dépassé : Claude Fable 5 atteint 95 % sur SWE-bench Verified, Claude Opus 5 prend le #1 WebDev Arena.
  • ImageGPT Image 1.5, Midjourney V8 et FLUX 2 dépassés par GPT Image 2 (21 avril).
  • VidéoSeedance 2.0 et Kling 3.0 détrônés par Gemini Omni Flash (19 mai). Sora 2 est en fin de vie (API arrêtée le 24 septembre 2026).
  • Open sourceMuse Spark n'est pas open source (modèle propriétaire Meta) : retiré de la catégorie. Nouveaux leaders : Kimi K3 (Moonshot, 27 juillet) et GLM-5.2 (Z.ai, 13 juin).

1. Meilleurs LLM (texte et raisonnement)

#01

Claude Opus 5

Anthropic

24 juillet 2026 · $5 / $25 par million de tokens

C'est aujourd'hui le meilleur choix « tout terrain » : rédaction longue, analyse de documents, stratégie, et surtout du code. Si vous ne devez en garder qu'une pour le travail intellectuel quotidien, c'est celle-ci. Elle arrive en tête de l'indice Artificial Analysis (61/176 modèles) et domine aussi les classements de développement web.

#1 Artificial Analysis Intelligence Index (61). Contexte 1 million de tokens.

AA Index
61
GPQA
~93,4 %
HLE
52,6 %
Contexte
1M

Points forts

  • Meilleur score global Intelligence Index
  • Excellent en code et raisonnement long

Points faibles

  • Réponses parfois trop longues (verbosité)
#02

Claude Fable 5

Anthropic

9 juin 2026 · $10 / $50 par million de tokens

Fable 5 est le modèle préféré des tests « humains en aveugle » (LM Arena, 1508,6 Elo). Il brille sur les tâches très dures — Humanity's Last Exam, et surtout le code de production (95 % sur SWE-bench Verified). À privilégier pour les chantiers complexes, moins pour le quotidien (il est cher).

#1 LM Arena texte. #1 Humanity's Last Exam (53,3 %).

LM Arena Elo
1508,6
HLE
53,3 %
SWE-bench
95 %
Contexte
1M

Points forts

  • Leader des votes humains LM Arena
  • Record SWE-bench Verified

Points faibles

  • Prix d'entrée/sortie élevé

Premier modèle frontière suspendu puis réactivé par un régulateur US (contrôle des exportations, 12 juin → 1er juillet 2026).

#03

GPT-5.6 Sol

OpenAI

9 juillet 2026 · modèle par défaut de ChatGPT · $5 / $30

C'est l'IA que la plupart des gens rencontrent dans ChatGPT. Sol mène les benchmarks de maths et de raisonnement (LiveBench, ARC-AGI-2). Idéal si vous voulez rester dans l'écosystème OpenAI (ChatGPT, Codex, plugins) sans jongler entre outils.

AA Index 59. #1 LiveBench Mathematics & Reasoning, #1 ARC-AGI-2.

AA Index
59
GPQA
~94-95 %
HLE
47,2 %
ARC-AGI-2
#1

Points forts

  • Intégré à ChatGPT et Codex
  • Tiers tarifaires Luna / Terra pour baisser la facture

Points faibles

  • Moins dominant que Claude sur LM Arena texte
#04

Gemini 3.1 Pro

Google

Inchangé depuis avril · repositionné « précision » · contexte 2M

Gemini reste imbattable quand il faut une fenêtre de contexte énorme (2 millions de tokens) ou croiser des infos avec Google Search. Moins « à la mode » qu'en avril, mais toujours le meilleur pour les dossiers volumineux et les questions scientifiques précises (GPQA Diamond ~95,5 %).

#1 GPQA Diamond (~95,5 %), 98 % ARC-AGI-1, grounding Google Search.

GPQA
~95,5 %
ARC-AGI-1
98 %
Contexte
2M

Points forts

  • Contexte géant
  • Précision scientifique + Search

Points faibles

  • Moins présent dans les tops agentiques 2026
#07

Grok 4.5

xAI

8 juillet 2026 · $2 / $6 par million de tokens

Grok 4.5 est le modèle frontière le moins cher du peloton, et le plus fort pour enchaîner des outils (agents). Si vous construisez des automatisations ou codez avec Cursor, c'est un excellent rapport qualité/prix. Attention : xAI ne publie pas encore ses scores GPQA/HLE.

AA Index 54. #1 usage d'outils agentiques. Contexte 500K.

AA Index
54
Outils
#1
Contexte
500K
Prix
$2 / $6

Points forts

  • Prix bas pour un modèle frontière
  • Très bon en agentique

Points faibles

  • Benchmarks scientifiques non publiés par xAI
Comparatif LLM août 2026
ModèleSortieElo LM ArenaAA IndexGPQAHLEContextePrix in/out
Claude Opus 524 juil. 202661~93,4 %52,6 %1M$5 / $25
Claude Fable 59 juin 20261508,653,3 %1M$10 / $50
GPT-5.6 Sol9 juil. 202659~94-95 %47,2 %$5 / $30
Gemini 3.1 Proavril 2026*~95,5 %2Mselon Google
Grok 4.58 juil. 202654n.p.n.p.500K$2 / $6

* Gemini 3.1 Pro inchangé depuis avril 2026, repositionné « précision ».

2. Meilleurs modèles pour le code

#01

Claude Opus 5

Anthropic

Modèle par défaut de Claude Code

Pour coder au quotidien (sites, apps, scripts), Opus 5 est le nouveau standard : #1 WebDev Arena (1702,9 Elo) et très haut sur SWE-bench. C'est celui que Claude Code utilise par défaut — le bon réflexe pour la plupart des développeurs.

#1 WebDev Arena (1702,9). SWE-bench ~96-97 %.

WebDev Arena
1702,9
SWE-bench
~96-97 %
image→Web
1668,6

Points forts

  • Meilleur modèle code généraliste août 2026

Points faibles

  • Coût élevé en gros volume
#02

Claude Fable 5

Anthropic

Record SWE-bench Verified

Quand le chantier est long (refacto massive, agent qui travaille des heures), Fable 5 garde le record SWE-bench Verified à 95 %. Moins utile pour les petits tickets ; précieux pour les missions critiques.

#1 SWE-bench Verified (95 %). #1 SWE-bench Pro (80,3 %).

SWE-bench Verified
95 %
SWE-bench Pro
80,3 %

Points forts

  • Tâches longues / agents

Points faibles

  • Tarif élevé ($10 / $50)
#03

GPT-5.6 Sol

OpenAI

Modèle par défaut de Codex

Si vous travaillez dans le terminal ou avec Codex, Sol mène Terminal-Bench 2.1 (89,5 %). Moins fort qu'Opus sur le pure Web, excellent pour l'outillage ligne de commande et l'écosystème OpenAI.

#1 Terminal-Bench 2.1 (89,5 %).

Terminal-Bench
89,5 %

Points forts

  • Terminal / tooling OpenAI

Points faibles

  • Moins fort que Claude sur WebDev Arena
#04

Kimi K3

Moonshot AI

Open-weight

Meilleur modèle open-weight pour le code : #2 WebDev Arena juste derrière Opus 5. Intéressant si vous voulez des poids ouverts sans sacrifier trop de performance — à condition d'avoir l'infra pour le faire tourner.

#2 WebDev Arena (1675,5). SWE-bench ~93,4 %.

WebDev Arena
1675,5
SWE-bench
~93,4 %

Points forts

  • Meilleur open-weight code

Points faibles

  • Déploiement lourd

En pratique : Copilot propose Opus 5, Sonnet 5, GPT-5.6, Gemini 3.1 Pro et Fable 5. Grok 4.5 est co-entraîné sur les données Cursor. Pour le quotidien économique, Claude Sonnet 5 ($2/$10 en promo jusqu'au 31 août) reste très viable.

Comparatif code août 2026
ModèleSWE-bench VerifiedWebDev Arena EloTerminal-BenchPrix
Claude Opus 5~96-97 %1702,9$5 / $25
Claude Fable 595 %$10 / $50
GPT-5.6 Sol89,5 %$5 / $30
Kimi K3~93,4 %1675,5$3 / $15

3. Génération d'images

#05

GPT Image 2

OpenAI

21 avril 2026 · inclus ChatGPT Plus / Pro

Pour générer ou éditer des images, GPT Image 2 écrase le classement (1339 Elo Artificial Analysis, écart record). Texte dans l'image quasi parfait, y compris en français. Le choix par défaut si vous êtes déjà sur ChatGPT.

#1 Text-to-Image AA (1339 Elo). #1 édition d'image (1258).

Elo AA
1339
Édition
1258

Points forts

  • Écart le plus large jamais mesuré
  • Rendu de texte multilingue

Points faibles

  • Surtout via ChatGPT / API OpenAI
  • Reve 2.1#2 AA (1299), modèle 4K « layout-first » (9 juillet) — utile pour les maquettes propres.
  • MAI-Image-2.5Microsoft, #3 AA (1270) — intéressant dans l'écosystème Microsoft 365.
  • Nano Banana 2Google — le meilleur choix gratuit (~1263 Elo).
  • Midjourney V8.1Toujours la référence esthétique/artistique, mais pas d'API publique ni d'offre gratuite (litige copyright en cours).
  • FLUX.2Meilleur open-weight image si vous auto-hébergez.
Comparatif images août 2026
ModèleElo AAPoints fortsAccès / prix
GPT Image 21339Texte, éditionChatGPT Plus/Pro + API
Reve 2.112994K layout-firstAPI Reve
MAI-Image-2.51270Écosystème Microsoftselon Microsoft
Nano Banana 2~1263Meilleur gratuitGratuit (Google)
Midjourney V8.1Esthétique artistiqueAbonnement MJ
FLUX.2Open-weightAuto-hébergement

4. Génération de vidéos

#06

Gemini Omni Flash

Google

19 mai 2026 · $0,10/s ($6/min)

Pour des clips courts avec son synchronisé, Omni Flash est #1 des deux classements vidéo (1527 Elo LM Arena, 45 points d'avance). Idéal pour des pubs courtes, des démos produit ou du social. Pas pour le long format : là, passez à Veo 3.1.

#1 Text-to-Video LM Arena (1527). Clips 10 s, audio sync, édition conversationnelle.

Elo
1527
Durée
10 s
Audio
Sync
Prix
$0,10/s

Points forts

  • Leader des boards vidéo août 2026

Points faibles

  • Clips courts (environ 10 s)
  • MiniMax H3 / Hailuo 3.031 juillet — #2 AA (1241,5), clips 2K 4-15 s avec audio stéréo ($0,13/s).
  • Seedance 2.0ByteDance — toujours en tête de l'image-to-video avec audio (1196 Elo AA).
  • Kling 3.0Kuaishou — meilleur choix « achetable » hors Google (1080p, 15 s).
Comparatif vidéos août 2026
ModèleEloDurée / résolutionAudioPrix/s
Gemini Omni Flash152710 sOui$0,10
MiniMax H31241,5 AA2K · 4-15 sStéréo$0,13
Seedance 2.01196 (i2v)selon ByteDanceOuiselon éditeur
Kling 3.01080p · 15 sselon offreselon Kuaishou
Veo 3.14K · 60 s+Ouiproduction longue

5. Open source et outsiders

#08

Kimi K3

Moonshot AI

Poids ouverts 27 juillet 2026 · $3 / $15

Kimi K3 est le plus grand open-weight jamais publié (2,8 mille milliards de paramètres) et le meilleur open-weight d'août (AA Index 57, #3 tous modèles confondus). À choisir si vous voulez des poids ouverts au niveau frontière — mais il faut une grosse infra (≥64 accélérateurs recommandés).

2,8T paramètres (104B actifs). AA Index 57. Contexte 1M. Vision native.

Params
2,8T
AA Index
57
Contexte
1M

Points forts

  • Meilleur open-weight août 2026
  • Niveau frontière

Points faibles

  • Infra très lourde
#09

GLM-5.2

Z.ai

13 juin 2026 · licence MIT

Si vous voulez de l'open-weight sans cluster monstrueux, GLM-5.2 est le meilleur mono-nœud (licence MIT, ~168 tokens/s, AA Index 51). Le choix réaliste pour une PME qui auto-héberge.

744B (~40B actifs). AA Index 51. #1 Design Arena code.

AA Index
51
Vitesse
~168 tok/s
Licence
MIT

Points forts

  • Mono-nœud réaliste
  • Licence MIT

Points faibles

  • Moins fort que Kimi K3 en score brut
#10

DeepSeek V4-Flash

DeepSeek

31 juillet 2026 · licence MIT · $0,14 / $0,28

Le champion du rapport prix/performance : AA Index 50 pour une fraction du coût des modèles frontière (~$0,03 par tâche d'index). Parfait pour du volume (support, classification, premiers jets) quand le budget prime.

AA Index 50. Meilleur prix/perf du marché.

AA Index
50
Prix in/out
$0,14 / $0,28

Points forts

  • Budget / scale

Points faibles

  • Moins capable qu'Opus ou Kimi

À noter aussi : Qwen 3.6/3.7 Max (Alibaba), Inkling (Thinking Machines, Apache 2.0 — meilleur open-weight US), Mistral pour l'entreprise UE. Llama 5 (Meta) n'est plus compétitif. Muse Spark est propriétaire : ce n'est plus un choix « ouvert ».

Ces modèles changent aussi la façon dont vos clients vous trouvent : être cité par les IA (GEO) devient un levier de visibilité à part entière, aux côtés d'une agence SEO.

Récapitulatif — le top 10 d'août 2026

Top 10 IA août 2026
RangModèleÉditeurCatégoriePourquoiPrix
#1Claude Opus 5AnthropicLLM / Code#1 AA Index, #1 WebDev Arena$5 / $25
#2Claude Fable 5AnthropicLLM / Code#1 LM Arena texte, SWE-bench 95 %$10 / $50
#3GPT-5.6 SolOpenAILLM#1 LiveBench Math, défaut ChatGPT$5 / $30
#4Gemini 3.1 ProGoogleLLMLeader GPQA, contexte 2Mselon Google
#5GPT Image 2OpenAIImage#1 génération d'images (1339 Elo)ChatGPT Plus/Pro
#6Gemini Omni FlashGoogleVidéo#1 vidéo (1527 Elo), audio sync$0,10/s
#7Grok 4.5xAILLM / AgentiqueMeilleur coût/agentique$2 / $6
#8Kimi K3Moonshot AIOpen-weightMeilleur open-weight, 2,8T params$3 / $15
#9GLM-5.2Z.aiOpen-weightMeilleur mono-nœud, MITauto-hébergement
#10DeepSeek V4-FlashDeepSeekOpen-weightMeilleur prix/performance$0,14 / $0,28

Comment choisir la bonne IA en août 2026 ?

Usage général

Claude Opus 5 ou GPT-5.6 Sol — selon que vous préférez Anthropic ou l'écosystème ChatGPT.

Code

Opus 5 au quotidien, Fable 5 pour les gros chantiers, Sonnet 5 si le budget compte.

Images

GPT Image 2. En gratuit : Nano Banana 2 (Google).

Vidéo

Gemini Omni Flash pour le court. Veo 3.1 pour le long format.

Auto-hébergement

GLM-5.2 (un nœud) ou DeepSeek V4-Flash (budget). Kimi K3 si vous avez l'infra.

Budget serré

Grok 4.5 (API) ou DeepSeek V4-Flash (volume).

Questions fréquentes

Méthodologie et sources

Sources : LM Arena / Arena.ai (arrêt des votes au 1er août 2026), Artificial Analysis (Intelligence Index v4.1), SWE-bench, annonces officielles des éditeurs. Les Elo sont des instantanés. Certains chiffres (Grok 4.5, DeepSeek, Kimi K3) viennent des éditeurs et ne sont pas tous répliqués indépendamment. Page mise à jour chaque mois.

Besoin d'un site qui convertit vraiment ?

Les meilleurs modèles accélèrent la production de contenus — encore faut-il un site lisible et un SEO local solide. Notre analyse SEO gratuite fait l'état des lieux en 24h.