Classement des modèles IA — Modèles par scoring
Les grands modèles d'IA, tous éditeurs et tous usages confondus, classés par la préférence des utilisateurs. Score : système Elo, d'après les votes d'Arena — comment ça marche ?
| Écart de rang | IA | ||||||
|---|---|---|---|---|---|---|---|
| 1 | 16 | Qwen 3.7 Plus Récent Alibaba · Qwen | 1511±9 | 35 900 | Qwen | ||
| 2 | 17 | Gemini 3 Pro Google · Gemini | 1509±10 | 4 700 | Gemini | $2 / $12 | 2M |
| 3 | 17 | GPT-5.1 OpenAI · ChatGPT | 1501±6 | 35 700 | ChatGPT | $1.25 / $10 | 400K |
| 4 | 17 | Kimi K3 Récent Moonshot AI · Kimi | 1500±6 | 48 400 | Kimi | ||
| 5 | 17 | DeepSeek V3.2 (Thinking) DeepSeek · DeepSeek | 1499±8 | 12 800 | DeepSeek | ||
| 6 | 17 | Claude Opus 4.6 (Thinking) Anthropic · Claude | 1496±7 | 67 800 | Claude | ||
| 7 | 215 | Grok 4.5 Récent xAI · Grok | 1487±13 | 63 500 | Grok | ||
| 8 | 713 | Claude Fable 5 Récent Anthropic · Claude | 1483±4 | 30 800 | Claude | ||
| 9 | 715 | MiMo V2.5 Pro Récent Xiaomi · MiMo | 1481±5 | 40 600 | MiMo | ||
| 10 | 715 | GPT-5.4 Récent OpenAI · ChatGPT | 1478±4 | 12 600 | ChatGPT | ||
| 11 | 715 | Gemma 4 26B Google · Gemini | 1477±9 | 63 100 | Gemini | ||
| 12 | 718 | Qwen 3.5 27B Alibaba · Qwen | 1473±6 | 62 800 | Qwen | ||
| 13 | 821 | Gemini 3.5 Flash Récent Google · Gemini | 1468±8 | 12 900 | Gemini | ||
| 14 | 721 | GLM-4.5 Zhipu AI · ChatGLM | 1468±12 | 10 500 | ChatGLM | ||
| 15 | 1221 | DeepSeek V4 Pro Récent DeepSeek · DeepSeek | 1463±4 | 54 000 | DeepSeek | $0.28 / $0.42 | 128K |
| 16 | 1221 | MiniMax M2 MiniMax · MiniMax | 1463±4 | 37 200 | MiniMax | ||
| 17 | 822 | Claude Sonnet 5 Récent Anthropic · Claude | 1463±13 | 34 900 | Claude | ||
| 18 | 1222 | DeepSeek V3.2 DeepSeek · DeepSeek | 1459±8 | 60 800 | DeepSeek | 128K | |
| 19 | 1325 | Claude Opus 4.8 Récent Anthropic · Claude | 1454±10 | 71 400 | Claude | $5 / $25 | 1M |
| 20 | 1326 | Nemotron 3 Ultra 550B Récent NVIDIA · Nemotron | 1451±12 | 39 100 | Nemotron | ||
| 21 | 1326 | GPT-5.5 Récent OpenAI · ChatGPT | 1449±11 | 27 300 | ChatGPT | ||
| 22 | 1725 | Claude Opus 4.7 Anthropic · Claude | 1447±7 | 46 500 | Claude | 200K | |
| 23 | 1928 | Gemini 2.5 Flash Google · Gemini | 1438±11 | 21 600 | Gemini | 1M | |
| 24 | 1928 | Grok 4.3 Récent xAI · Grok | 1437±11 | 3 100 | Grok | ||
| 25 | 1929 | DeepSeek V3 DeepSeek · DeepSeek | 1434±13 | 23 300 | DeepSeek | ||
| 26 | 2329 | Kimi K2.6 Moonshot AI · Kimi | 1429±8 | 23 200 | Kimi | ||
| 27 | 2130 | Llama 4 Maverick Meta · Meta AI | 1426±13 | 20 900 | Meta AI | ||
| 28 | 2330 | Mistral Large 3 Mistral AI · Le Chat | 1424±13 | 22 700 | Le Chat | ||
| 29 | 2530 | GPT-5 Mini OpenAI · ChatGPT | 1415±9 | 65 200 | ChatGPT | 200K | |
| 30 | 2730 | Claude Haiku 4.5 Anthropic · Claude | 1406±7 | 35 800 | Claude |
Aucun modèle ne correspond à votre recherche.
Aucun modèle classé pour le moment.
Score Elo façon Arena (préférences humaines) : « 1506 ±5 » = score et intervalle de confiance à 95 %. Rang par score ; l'écart de rang = la fourchette compatible avec cet intervalle. Votes = nombre de duels jugés. « IA » = l'outil auquel le modèle se rattache. Cliquez les en-têtes pour trier, les pastilles pour changer de classement.
Comment le score est-il calculé ?
Le score est un Elo, à la façon d'Arena : des personnes comparent deux modèles à l'aveugle sur une même demande et désignent le meilleur. Chaque duel déplace le score des deux modèles ; plus un modèle gagne face à des adversaires forts, plus il monte. Le « ± » est l'intervalle de confiance à 95 % : il se resserre à mesure que les votes s'accumulent.
Le rang suit le score. L'écart de rang (« 1 ⊸ 7 ») donne les places qu'un modèle peut réellement occuper une fois l'incertitude prise en compte : deux modèles dont les intervalles se recouvrent ne sont pas départagés. Chaque classement (général, par modalité, par tâche) a ses propres scores, votes et rangs ; un modèle qui n'a pas été évalué dans un classement n'y figure pas.