Comment ça marche
La vitesse d'écriture dépend de la bande passante mémoire
Pour écrire chaque token, le Mac lit une fois tous les poids actifs du modèle. La vitesse d'écriture (decode) est donc à peu près la bande passante mémoire divisée par la taille de ces poids. Une puce M5 Max lit 614 Go par seconde : un modèle dense de 70 milliards de paramètres en 4 bits pèse environ 40 Go, il écrit donc environ 13 tokens par seconde.
Le simulateur utilise 75 à 87 % de la bande passante avec MLX selon la quantification (5 points de moins avec llama.cpp), plus un coût fixe par token mesuré sur chaque type de puce et de modèle. Une longue conversation ralentit tout : chaque nouveau token relit aussi le cache KV, la mémoire du contexte.
La vitesse de lecture dépend du GPU
Avant de répondre, le modèle lit votre prompt (prefill). Cette étape est limitée par la puissance de calcul : environ 2 opérations par paramètre actif et par token, plus l'attention, qui croît avec le carré de la longueur du prompt.
Les puces M5 et M6 ont un Neural Accelerator dans chaque cœur GPU. MLX s'en sert (macOS 26.2 et suivants) : les prompts sont lus 3,5 à 4 fois plus vite que sur M4. llama.cpp s'en sert depuis avril 2026 pour les produits de matrices, pas encore pour l'attention.
Ce qui décide si un modèle tient
Les poids, le cache KV et les tampons du moteur doivent tenir dans la mémoire que macOS laisse au GPU. Sur macOS 26 et 27, c'est 74 % de 16 ou 24 Go, 78 % de 32 à 48 Go, 81 % de 64 ou 96 Go, 84 % de 128 Go, 87 % de 256 Go et 464 Go sur 512 Go. La commande sudo sysctl iogpu.wired_limit_mb la relève jusqu'au prochain redémarrage.
Les tailles de mémoire d'Apple sont binaires : 16 Go font 17,2 milliards d'octets. Les tailles des modèles sont ici en milliards d'octets, comme sur Hugging Face.
Quantification et mélanges d'experts
La quantification stocke chaque poids sur moins de bits. 4 bits est le choix habituel : le modèle est 3,5 fois plus petit qu'en 16 bits et perd peu en qualité. 8 bits est presque sans perte. Un gros modèle en 4 bits fait en général mieux qu'un petit en 8 bits.
Un mélange d'experts (MoE) comme gpt-oss, Qwen3.6 35B A3B ou DeepSeek n'utilise que quelques experts par token. Tous ses poids doivent tenir en mémoire, mais chaque token ne lit que les poids actifs : gpt-oss 120B demande 65 Go et écrit comme un modèle de 5 milliards de paramètres.
La fiabilité des chiffres
Les constantes viennent d'environ 300 mesures publiées : le fil de benchmarks de llama.cpp, les résultats MLX et oMLX, les chiffres d'Apple et les tests des Mac M5 et M6. Les estimations sont en général à moins de 15 % d'une mesure faite avec le même logiciel. Votre vitesse dépend de l'application, de sa version et de ses réglages : Ollama, LM Studio et llama.cpp n'utilisent pas tous le même moteur.
Les prix sont ceux de l'Apple Store de la devise choisie au 1er octobre 2026, avec le stockage de base. Apple les a augmentés le 25 juin 2026. En France (et au Royaume-Uni pour les MacBook Air et Pro), les MacBook sont vendus sans adaptateur secteur. Le Mac Studio avec 512 Go arrive fin octobre 2026 : son prix n'est pas encore publié.