Les meilleurs modèles d'IA pour le suivi de consignes
Suivi de consignes : la capacité du modèle à respecter à la lettre ce qu'on lui demande — format, longueur, contraintes, interdits. Réussir, c'est livrer exactement ce qui était demandé, sans en faire plus ni moins. Score : système Elo, d'après les votes d'Arena — comment ça marche ?
| Écart de rang | IA | ||||||
|---|---|---|---|---|---|---|---|
| Qwen 3.7 Plus Récent Alibaba · Qwen | Qwen | ||||||
| Gemini 3 Pro Google · Gemini | Gemini | $2 / $12 | 2M | ||||
| GPT-5.1 OpenAI · ChatGPT | ChatGPT | $1.25 / $10 | 400K | ||||
| Kimi K3 Récent Moonshot AI · Kimi | Kimi | ||||||
| DeepSeek V3.2 (Thinking) DeepSeek · DeepSeek | DeepSeek | ||||||
| Claude Opus 4.6 (Thinking) Anthropic · Claude | Claude | ||||||
| Grok 4.5 Récent xAI · Grok | Grok | ||||||
| Claude Fable 5 Récent Anthropic · Claude | Claude | ||||||
| MiMo V2.5 Pro Récent Xiaomi · MiMo | MiMo | ||||||
| GPT-5.4 Récent OpenAI · ChatGPT | ChatGPT | ||||||
| Gemma 4 26B Google · Gemini | Gemini | ||||||
| Qwen 3.5 27B Alibaba · Qwen | Qwen | ||||||
| Gemini 3.5 Flash Récent Google · Gemini | Gemini | ||||||
| GLM-4.5 Zhipu AI · ChatGLM | ChatGLM | ||||||
| DeepSeek V4 Pro Récent DeepSeek · DeepSeek | DeepSeek | $0.28 / $0.42 | 128K | ||||
| MiniMax M2 MiniMax · MiniMax | MiniMax | ||||||
| Claude Sonnet 5 Récent Anthropic · Claude | Claude | ||||||
| DeepSeek V3.2 DeepSeek · DeepSeek | DeepSeek | 128K | |||||
| Claude Opus 4.8 Récent Anthropic · Claude | Claude | $5 / $25 | 1M | ||||
| Nemotron 3 Ultra 550B Récent NVIDIA · Nemotron | Nemotron | ||||||
| GPT-5.5 Récent OpenAI · ChatGPT | ChatGPT | ||||||
| Claude Opus 4.7 Anthropic · Claude | Claude | 200K | |||||
| Gemini 2.5 Flash Google · Gemini | Gemini | 1M | |||||
| Grok 4.3 Récent xAI · Grok | Grok | ||||||
| DeepSeek V3 DeepSeek · DeepSeek | DeepSeek | ||||||
| Kimi K2.6 Moonshot AI · Kimi | Kimi | ||||||
| Llama 4 Maverick Meta · Meta AI | Meta AI | ||||||
| Mistral Large 3 Mistral AI · Le Chat | Le Chat | ||||||
| GPT-5 Mini OpenAI · ChatGPT | ChatGPT | 200K | |||||
| Claude Haiku 4.5 Anthropic · Claude | Claude |
Aucun modèle ne correspond à votre recherche.
Aucun modèle classé en Chat › Suivi de consignes pour le moment.
Score Elo façon Arena (préférences humaines) : « 1506 ±5 » = score et intervalle de confiance à 95 %. Rang par score ; l'écart de rang = la fourchette compatible avec cet intervalle. Votes = nombre de duels jugés. « IA » = l'outil auquel le modèle se rattache. Cliquez les en-têtes pour trier, les pastilles pour changer de classement.
Comment le score est-il calculé ?
Le score est un Elo, à la façon d'Arena : des personnes comparent deux modèles à l'aveugle sur une même demande et désignent le meilleur. Chaque duel déplace le score des deux modèles ; plus un modèle gagne face à des adversaires forts, plus il monte. Le « ± » est l'intervalle de confiance à 95 % : il se resserre à mesure que les votes s'accumulent.
Le rang suit le score. L'écart de rang (« 1 ⊸ 7 ») donne les places qu'un modèle peut réellement occuper une fois l'incertitude prise en compte : deux modèles dont les intervalles se recouvrent ne sont pas départagés. Chaque classement (général, par modalité, par tâche) a ses propres scores, votes et rangs ; un modèle qui n'a pas été évalué dans un classement n'y figure pas.