LLM en local sur Mac

Quels modèles ouverts votre Mac peut-il faire tourner, et à quelle vitesse ? Choisissez un Mac de la gamme actuelle d'Apple, du MacBook Neo au Mac Studio, et un modèle : le simulateur vérifie qu'il tient en mémoire et estime combien de tokens par seconde il écrit et lit. Tous les autres modèles et tous les autres Mac sont comparés aussi. Ce sont des estimations, calibrées sur des mesures publiées.

Paramètres

Mac

Modèle

Usage

tokens

Gemma 4 26B A4B sur un MacBook Pro 14 pouces avec 48 Go écrit

83 tok/s

Bien plus vite que vous ne lisez. Avec un contexte plein de 32 768 tokens : 54 tok/s.

Vitesse de lecture
2 302 tok/s
Traitement du prompt, avec les Neural Accelerators du GPU.
Temps de lecture du contexte
17 s
Un prompt de 32 768 tokens, avant le premier mot de la réponse.
Écriture, contexte plein
54 tok/s
Une fois 32 768 tokens en mémoire.
Mémoire nécessaire
17 Go
40 Go utilisables par le GPU, sur 48 Go.
Mémoire
17 Go sur 40 Go
  • Poids (4,5 bits par poids)15 Go
  • Cache KV (32 768 tokens)0,9 Go
  • Tampons du moteur1,1 Go

Il reste 23 Go au GPU.

M5 Pro, CPU 18 cœurs, GPU 20 cœurs
CPU
18 cœurs (6 super + 12 performance)
GPU
20 cœurs
Bande passante mémoire
307 Go/s
Puissance GPU (FP32)
8,3 TFLOPS
Neural Accelerators (FP16)
33 TFLOPS
Neural Engine
16 cœurs
Prix
3 809 €

Prix : Apple Store France, TVA incluse, stockage de base. La devise choisit la boutique.

Les Mac les moins chers pour Gemma 4 26B A4B

En 4 bits, avec un contexte de 32 768 tokens. Prix : Apple Store France, TVA incluse.

Le moins cher rapide (30 tok/s)
1 269 €
Mac mini, M6 · GPU 12, 24 Go
53 tok/s

Les modèles sur ce Mac

23 modèles sur 39 tiennent, en 4 bits, avec un contexte de 32 768 tokens (ou le maximum du modèle s'il est plus court).

ModèleMémoireÉcritureVerdict
Llama 3.2 1B
Meta · 1,2 Md
2,8 Go309 tok/sRapide
Qwen3.5 2B
Alibaba · 2,3 Md
3,2 Go181 tok/sRapide
Gemma 4 E2B
Google · 5,1 Md
4,9 Go179 tok/sRapide
Llama 3.2 3B
Meta · 3,2 Md
6,6 Go132 tok/sRapide
SmolLM3 3B
Hugging Face · 3,1 Md
5,2 Go137 tok/sRapide
Nemotron 3 Nano 4B
NVIDIA · 4 Md
3,9 Go108 tok/sRapide
Qwen3.5 4B
Alibaba · 4,7 Md
5,2 Go93 tok/sRapide
Gemma 4 E4B
Google · 8 Md
6,7 Go96 tok/sRapide
Llama 3.1 8B
Meta · 8 Md
9,9 Go55 tok/sRapide
Granite 4.2 8B
IBM · 8,8 Md
11 Go50 tok/sRapide
Qwen3.5 9B
Alibaba · 9,7 Md
8,2 Go46 tok/sRapide
Gemma 4 12B
Google · 12 Md
8,6 Go37 tok/sRapide
Ministral 3 14B
Mistral AI · 14 Md
15 Go32 tok/sRapide
Phi-4
Microsoft · 14,7 Md
13 Go30 tok/sRapide
gpt-oss 20B
OpenAI · 20,9 Md, 3,6 Md actifs (MoE)
14 Go77 tok/sRapide
Devstral Small 2 24B
Mistral AI · 24 Md
22 Go19 tok/sConfortable
Gemma 4 26B A4B
Google · 25,2 Md, 3,8 Md actifs (MoE)
17 Go83 tok/sRapide
Qwen3.8 27B
Alibaba · 27,8 Md
19 Go16 tok/sConfortable
Muse Glimmer 30B
Meta · 29,6 Md
21 Go16 tok/sConfortable
GLM-4.7-Flash
Z.ai · 30 Md, 3 Md actifs (MoE)
20 Go54 tok/sRapide
Nemotron 3.5 Lightning 30B A3B
NVIDIA · 30 Md, 3 Md actifs (MoE)
19 Go78 tok/sRapide
Gemma 4 31B
Google · 30,7 Md
23 Go15 tok/sConfortable
Qwen3.6 35B A3B
Alibaba · 35 Md, 3 Md actifs (MoE)
22 Go88 tok/sRapide

Trop gros pour ce Mac : Llama 3.3 70B (52 Go), Qwen3-Coder-Next (47 Go), gpt-oss 120B (66 Go), Mistral Small 4 119B (70 Go), Nemotron 3 Super 120B A12B (70 Go), Qwen3.5 122B A10B (72 Go), Mistral Medium 3.5 128B (91 Go), Qwen3.8 Flash Next (114 Go), MiniMax M2.7 (138 Go), DeepSeek V4 Flash (153 Go), GLM-5.3-Flash (206 Go), Qwen3.5 397B A17B (226 Go), MiniMax M3 (249 Go), DeepSeek V3.2 (382 Go), GLM-5.3 (422 Go), Kimi K2.6 (581 Go).

Comment ça marche

La vitesse d'écriture dépend de la bande passante mémoire

Pour écrire chaque token, le Mac lit une fois tous les poids actifs du modèle. La vitesse d'écriture (decode) est donc à peu près la bande passante mémoire divisée par la taille de ces poids. Une puce M5 Max lit 614 Go par seconde : un modèle dense de 70 milliards de paramètres en 4 bits pèse environ 40 Go, il écrit donc environ 13 tokens par seconde.

Le simulateur utilise 75 à 87 % de la bande passante avec MLX selon la quantification (5 points de moins avec llama.cpp), plus un coût fixe par token mesuré sur chaque type de puce et de modèle. Une longue conversation ralentit tout : chaque nouveau token relit aussi le cache KV, la mémoire du contexte.

La vitesse de lecture dépend du GPU

Avant de répondre, le modèle lit votre prompt (prefill). Cette étape est limitée par la puissance de calcul : environ 2 opérations par paramètre actif et par token, plus l'attention, qui croît avec le carré de la longueur du prompt.

Les puces M5 et M6 ont un Neural Accelerator dans chaque cœur GPU. MLX s'en sert (macOS 26.2 et suivants) : les prompts sont lus 3,5 à 4 fois plus vite que sur M4. llama.cpp s'en sert depuis avril 2026 pour les produits de matrices, pas encore pour l'attention.

Ce qui décide si un modèle tient

Les poids, le cache KV et les tampons du moteur doivent tenir dans la mémoire que macOS laisse au GPU. Sur macOS 26 et 27, c'est 74 % de 16 ou 24 Go, 78 % de 32 à 48 Go, 81 % de 64 ou 96 Go, 84 % de 128 Go, 87 % de 256 Go et 464 Go sur 512 Go. La commande sudo sysctl iogpu.wired_limit_mb la relève jusqu'au prochain redémarrage.

Les tailles de mémoire d'Apple sont binaires : 16 Go font 17,2 milliards d'octets. Les tailles des modèles sont ici en milliards d'octets, comme sur Hugging Face.

Quantification et mélanges d'experts

La quantification stocke chaque poids sur moins de bits. 4 bits est le choix habituel : le modèle est 3,5 fois plus petit qu'en 16 bits et perd peu en qualité. 8 bits est presque sans perte. Un gros modèle en 4 bits fait en général mieux qu'un petit en 8 bits.

Un mélange d'experts (MoE) comme gpt-oss, Qwen3.6 35B A3B ou DeepSeek n'utilise que quelques experts par token. Tous ses poids doivent tenir en mémoire, mais chaque token ne lit que les poids actifs : gpt-oss 120B demande 65 Go et écrit comme un modèle de 5 milliards de paramètres.

La fiabilité des chiffres

Les constantes viennent d'environ 300 mesures publiées : le fil de benchmarks de llama.cpp, les résultats MLX et oMLX, les chiffres d'Apple et les tests des Mac M5 et M6. Les estimations sont en général à moins de 15 % d'une mesure faite avec le même logiciel. Votre vitesse dépend de l'application, de sa version et de ses réglages : Ollama, LM Studio et llama.cpp n'utilisent pas tous le même moteur.

Les prix sont ceux de l'Apple Store de la devise choisie au 1er octobre 2026, avec le stockage de base. Apple les a augmentés le 25 juin 2026. En France (et au Royaume-Uni pour les MacBook Air et Pro), les MacBook sont vendus sans adaptateur secteur. Le Mac Studio avec 512 Go arrive fin octobre 2026 : son prix n'est pas encore publié.

Questions fréquentes

Quel Mac pour faire tourner gpt-oss 120B ?

Plus de 64 Go de mémoire : il lui faut environ 66 Go et les Mac de 64 Go laissent 56 Go au GPU. Le moins cher est le Mac Studio M5 Max avec 128 Go (5 859 €), à environ 89 tokens par seconde. Le MacBook Pro M5 Max avec 128 Go va aussi vite. Le Mac Studio M5 Ultra avec 96 Go (6 599 €) en écrit environ 113.

Combien de mémoire pour un modèle de 70 milliards de paramètres ?

Llama 3.3 70B en 4 bits demande environ 40 Go de poids, plus 11 Go de cache KV pour un contexte de 32 768 tokens. Un Mac de 64 Go le fait tourner, lentement : environ 6 tokens par seconde sur une puce M5 Pro, 13 sur une M5 Max. Une M5 Ultra (96 Go minimum) en écrit environ 23.

Un MacBook Neo ou un MacBook Air peut-il faire tourner un LLM en local ?

Oui, des petits. Le MacBook Neo a 8 Go : des modèles jusqu'à 4 milliards de paramètres, comme Qwen3.5 4B à environ 19 tokens par seconde. Un MacBook Air de 16 Go fait tourner des modèles jusqu'à 14 milliards (Phi-4 à environ 15 tokens par seconde, Llama 3.1 8B à environ 28). Ils n'ont pas de ventilateur : les longs prompts ralentissent quand la puce chauffe.

MLX ou llama.cpp (Ollama, LM Studio) ?

Sur Mac, MLX est en général un peu plus rapide. Il est bien plus rapide sur les modèles hybrides comme Qwen3.5 et Qwen3.6 (1,4 à 1,9 fois), et il lit les prompts plus vite sur M5 et M6. LM Studio fait tourner les deux. Ollama fait tourner certains modèles sur MLX et les autres sur llama.cpp.

Pourquoi un modèle de 35 milliards va-t-il plus vite qu'un de 8 milliards ?

Parce que c'est un mélange d'experts. Qwen3.6 35B A3B n'utilise que 3 milliards de paramètres par token : avec MLX, il écrit plus vite qu'un modèle dense de 8 milliards, mais ses 35 milliards de paramètres doivent tous tenir en mémoire.

Peut-on faire tourner DeepSeek ou Kimi sur un Mac ?

DeepSeek V4 Flash, oui : en 4 bits il demande environ 150 Go et tourne sur un Mac Studio M5 Ultra de 256 Go, à environ 48 tokens par seconde. DeepSeek V3.2 et Kimi demandent le Mac Studio M5 Ultra avec 512 Go, qui arrive fin octobre 2026. DeepSeek V3.2 en 4 bits demande environ 380 Go et écrit environ 25 tokens par seconde. Kimi K2.6 (1 000 milliards de paramètres) ne tient qu'en 3 bits.

Mes réglages sont-ils envoyés quelque part ?

Non. Les calculs se font dans votre navigateur. Rien n'est envoyé tant que vous ne cliquez pas sur Enregistrer ou Partager.

Autres simulateurs