Section 06 — Déploiement
Matrice de compatibilité
Déploiement local, serveur et format API
Déploiement : local (Desktop/Ollama/LM Studio ≤48GB VRAM), serveur (vLLM/TGI/Ollama), format API. Le tableau est scindé en deux blocs : les derniers modèles sortis (générations en cours), puis les générations antérieures encore en activité — toujours servies et facturées par leur éditeur.
Légende
Oui
Partiel / MG
Non
En cours
Génération antérieure
MG = multi-GPU · Q4 = quantification 4-bit
Derniers modèles sortis — générations en cours 21 modèles
Modèles les plus récents de leur gamme. Lorsqu'un modèle remplace une génération antérieure, celle-ci est présentée dans le second tableau (elle reste servie et facturée par son éditeur).
| Modèle | Open Source | Licence | Local (Desktop) | Serveur | Format API |
|---|---|---|---|---|---|
| Claude Fable 5.1En cours | Non | Propriétaire | Non | Non | Anthropic |
| Claude Haiku 4.5En cours | Non | Propriétaire | Non | Non | Anthropic |
| Claude Mythos 5.1En cours | Non | Propriétaire | Non | Non | Anthropic |
| Claude Opus 5En cours | Non | Propriétaire | Non | Non | Anthropic |
| Claude Sonnet 5En cours | Non | Propriétaire | Non | Non | Anthropic |
| DeepSeek V4.1 FlashEn cours | Oui | MIT | Oui (~48GB Q4) | Oui | OpenAI + Anthropic |
| Gemini 3.1 Flash-LiteEn cours | Non | Propriétaire | Non | Non | Gemini API |
| Gemini 3.1 ProEn cours | Non | Propriétaire | Non | Non | Gemini API |
| Gemini 3.8 FlashEn cours | Non | Propriétaire | Non | Non | Gemini API |
| GLM-5.3En cours | Oui | MIT | Non (730B MoE) | Oui | OpenAI-compat. |
| GLM-5.3 FlashEn cours | Oui | MIT | Non (320B MoE) | Oui | OpenAI-compat. |
| GPT-5.6 LunaEn cours | Non | Propriétaire | Non | Non | OpenAI |
| GPT-5.6 TerraEn cours | Non | Propriétaire | Non | Non | OpenAI |
| GPT-6 AstraEn cours | Non | Propriétaire | Non | Non | OpenAI |
| Grok Build 0.1En cours | Non | Propriétaire | Non | Non | OpenAI-compat. |
| Meta Muse GlimmerEn cours | Oui | Apache 2.0 | Oui (~24GB) | Oui | OpenAI (vLLM) |
| Mistral Large 3En cours | Oui | Apache 2.0 | Non (grand modèle) | Oui | Mistral API + OpenAI |
| Mistral Small 4En cours | Oui | Apache 2.0 | Non (119B MoE) | Oui | OpenAI (vLLM) |
| Muse Spark 1.3En cours | Non | Propriétaire | Non | Non | OpenAI-compat. |
| Qwen3.8-27BEn cours | Oui | Apache 2.0 | Oui (~20GB Q4) | Oui | OpenAI (vLLM) |
| Qwen3.8-MaxEn cours | Non | Propriétaire | Non | Non | OpenAI-compat. |
Générations antérieures encore en activité 21 modèles
Modèles plus anciens toujours servis et facturés par leur éditeur ; certains coexistent avec la version qui les remplace.
| Modèle | Open Source | Licence | Local (Desktop) | Serveur | Format API |
|---|---|---|---|---|---|
| Claude Fable 5Génération antérieure | Non | Propriétaire | Non | Non | Anthropic |
| Claude Opus 4.8Génération antérieure | Non | Propriétaire | Non | Non | Anthropic |
| Claude Sonnet 4.6Génération antérieure | Non | Propriétaire | Non | Non | Anthropic |
| DeepSeek V4 ProGénération antérieure⚠ Retrait programmé | Oui | MIT | Non (862GB) | Oui (MG) | OpenAI + Anthropic |
| Gemini 3 FlashGénération antérieure | Non | Propriétaire | Non | Non | Gemini API |
| Gemini 3.5 FlashGénération antérieure | Non | Propriétaire | Non | Non | Gemini API |
| GLM-4.7-FlashXGénération antérieure | Oui | MIT | Oui (~8GB Q4) | Oui | OpenAI-compat. |
| GLM-5.1 (MIT)Génération antérieure | Oui | MIT | Oui (~32GB Q4) | Oui | OpenAI-compat. |
| GLM-5.2Génération antérieure | Oui | MIT | Oui (~32GB Q4) | Oui | OpenAI-compat. |
| GPT-5.4 miniGénération antérieure | Non | Propriétaire | Non | Non | OpenAI |
| GPT-5.4 nanoGénération antérieure | Non | Propriétaire | Non | Non | OpenAI |
| GPT-5.6 SolGénération antérieure | Non | Propriétaire | Non | Non | OpenAI |
| Grok 4.3Génération antérieure | Non | Propriétaire | Non | Non | OpenAI-compat. |
| Grok 4.5Génération antérieure | Non | Propriétaire | Non | Non | OpenAI-compat. |
| Grok 4.6Génération antérieure | Non | Propriétaire | Non | Non | OpenAI-compat. |
| Llama 4 MaverickGénération antérieure | Non* | Meta Community | Non (MG) | Oui (MG) | OpenAI (vLLM) |
| Llama 4 ScoutGénération antérieure | Non* | Meta Community | Oui (Q4, ~24GB) | Oui | OpenAI (vLLM) |
| Qwen3 235BGénération antérieure | Oui | Apache 2.0 | Non (MoE large) | Oui (MG) | OpenAI (vLLM) |
| Qwen3 30BGénération antérieure | Oui | Apache 2.0 | Oui (~20GB Q4) | Oui | OpenAI (vLLM) |
| Qwen3.7 MaxGénération antérieure | Non | Propriétaire | Non | Non | OpenAI-compat. |
| Qwen3.7 PlusGénération antérieure | Non | Propriétaire | Non | Non | OpenAI-compat. |
Modèles déployables en local
≤ 48 Go de VRAM (Ollama / LM Studio)8 modèles open-source peuvent être exécutés sur un poste équipé en GPU (≤48 Go VRAM), via Ollama, LM Studio ou llama.cpp.