Les meilleurs modèles d'IA pour le code
Code : la capacité du modèle à produire, à partir d'un simple brief, une application web qui marche et qui a de l'allure — structure, logique, interface. Réussir, c'est livrer le résultat que l'on choisirait entre deux propositions. Score : système Elo, d'après les votes d'Arena — comment ça marche ?
| Écart de rang | IA | ||||||
|---|---|---|---|---|---|---|---|
| 2 | 16 | Qwen 3.7 Plus Récent Alibaba · Qwen | 1491±13 | 10 900 | Qwen | ||
| Gemini 3 Pro Google · Gemini | Gemini | $2 / $12 | 2M | ||||
| 1 | 15 | GPT-5.1 OpenAI · ChatGPT | 1492±6 | 61 500 | ChatGPT | $1.25 / $10 | 400K |
| 3 | 16 | Kimi K3 Récent Moonshot AI · Kimi | 1489±10 | 36 200 | Kimi | ||
| DeepSeek V3.2 (Thinking) DeepSeek · DeepSeek | DeepSeek | ||||||
| 4 | 16 | Claude Opus 4.6 (Thinking) Anthropic · Claude | 1486±6 | 32 500 | Claude | ||
| Grok 4.5 Récent xAI · Grok | Grok | ||||||
| Claude Fable 5 Récent Anthropic · Claude | Claude | ||||||
| 7 | 511 | MiMo V2.5 Pro Récent Xiaomi · MiMo | 1468±9 | 56 200 | MiMo | ||
| GPT-5.4 Récent OpenAI · ChatGPT | ChatGPT | ||||||
| Gemma 4 26B Google · Gemini | Gemini | ||||||
| 9 | 612 | Qwen 3.5 27B Alibaba · Qwen | 1459±10 | 68 700 | Qwen | ||
| Gemini 3.5 Flash Récent Google · Gemini | Gemini | ||||||
| 5 | 17 | GLM-4.5 Zhipu AI · ChatGLM | 1482±10 | 71 000 | ChatGLM | ||
| 10 | 611 | DeepSeek V4 Pro Récent DeepSeek · DeepSeek | 1458±4 | 48 800 | DeepSeek | $0.28 / $0.42 | 128K |
| MiniMax M2 MiniMax · MiniMax | MiniMax | ||||||
| 8 | 611 | Claude Sonnet 5 Récent Anthropic · Claude | 1460±4 | 25 600 | Claude | ||
| DeepSeek V3.2 DeepSeek · DeepSeek | DeepSeek | 128K | |||||
| 6 | 211 | Claude Opus 4.8 Récent Anthropic · Claude | 1469±11 | 37 900 | Claude | $5 / $25 | 1M |
| Nemotron 3 Ultra 550B Récent NVIDIA · Nemotron | Nemotron | ||||||
| GPT-5.5 Récent OpenAI · ChatGPT | ChatGPT | ||||||
| 12 | 1012 | Claude Opus 4.7 Anthropic · Claude | 1444±6 | 38 700 | Claude | 200K | |
| Gemini 2.5 Flash Google · Gemini | Gemini | 1M | |||||
| Grok 4.3 Récent xAI · Grok | Grok | ||||||
| 11 | 612 | DeepSeek V3 DeepSeek · DeepSeek | 1453±11 | 62 900 | DeepSeek | ||
| Kimi K2.6 Moonshot AI · Kimi | Kimi | ||||||
| Llama 4 Maverick Meta · Meta AI | Meta AI | ||||||
| 13 | 13 | Mistral Large 3 Mistral AI · Le Chat | 1419±7 | 29 800 | Le Chat | ||
| GPT-5 Mini OpenAI · ChatGPT | ChatGPT | 200K | |||||
| Claude Haiku 4.5 Anthropic · Claude | Claude |
Aucun modèle ne correspond à votre recherche.
Aucun modèle classé en Code pour le moment.
Score Elo façon Arena (préférences humaines) : « 1506 ±5 » = score et intervalle de confiance à 95 %. Rang par score ; l'écart de rang = la fourchette compatible avec cet intervalle. Votes = nombre de duels jugés. « IA » = l'outil auquel le modèle se rattache. Cliquez les en-têtes pour trier, les pastilles pour changer de classement.
Comment le score est-il calculé ?
Le score est un Elo, à la façon d'Arena : des personnes comparent deux modèles à l'aveugle sur une même demande et désignent le meilleur. Chaque duel déplace le score des deux modèles ; plus un modèle gagne face à des adversaires forts, plus il monte. Le « ± » est l'intervalle de confiance à 95 % : il se resserre à mesure que les votes s'accumulent.
Le rang suit le score. L'écart de rang (« 1 ⊸ 7 ») donne les places qu'un modèle peut réellement occuper une fois l'incertitude prise en compte : deux modèles dont les intervalles se recouvrent ne sont pas départagés. Chaque classement (général, par modalité, par tâche) a ses propres scores, votes et rangs ; un modèle qui n'a pas été évalué dans un classement n'y figure pas.