# Quel Mac pour un LLM en local ? Modèles et vitesse (tok/s) par Mac

> Tous les Mac en vente, du MacBook Neo au Mac Studio : quels modèles ouverts tiennent en mémoire (gpt-oss, Qwen, Gemma, Llama, DeepSeek...) et combien de tokens par seconde ils écrivent et lisent. Gratuit.

- Version interactive : https://simulkit.com/fr/mac-llm-local
- Autres langues : [English](https://simulkit.com/en/mac-local-llm.md)

Quels modèles ouverts votre Mac peut-il faire tourner, et à quelle vitesse ? Choisissez un Mac de la gamme actuelle d'Apple, du MacBook Neo au Mac Studio, et un modèle : le simulateur vérifie qu'il tient en mémoire et estime combien de tokens par seconde il écrit et lit. Tous les autres modèles et tous les autres Mac sont comparés aussi. Ce sont des estimations, calibrées sur des mesures publiées.

## Paramètres

### Mac

| Paramètre | Clé d'URL | Par défaut | Plage | Description |
|---|---|---|---|---|
| Mac | `mac` | MacBook Pro 14 pouces | `macbook-neo` MacBook Neo 13 pouces, `macbook-air-13` MacBook Air 13 pouces, `macbook-air-15` MacBook Air 15 pouces, `macbook-pro-14` MacBook Pro 14 pouces, `macbook-pro-16` MacBook Pro 16 pouces, `imac` iMac 24 pouces, `mac-mini` Mac mini, `mac-studio` Mac Studio | Tous les Mac vendus neufs par Apple aujourd'hui. |
| Puce | `chip` | M5 Pro, CPU 18 cœurs, GPU 20 cœurs | `a18-pro` A18 Pro, CPU 6 cœurs, GPU 5 cœurs, `m4-8-8` M4, CPU 8 cœurs, GPU 8 cœurs, `m4-10-10` M4, CPU 10 cœurs, GPU 10 cœurs, `m5-10-8` M5, CPU 10 cœurs, GPU 8 cœurs, `m5-10-10` M5, CPU 10 cœurs, GPU 10 cœurs, `m6-12-12` M6, CPU 12 cœurs, GPU 12 cœurs, `m5-pro-15-16` M5 Pro, CPU 15 cœurs, GPU 16 cœurs, `m5-pro-18-20` M5 Pro, CPU 18 cœurs, GPU 20 cœurs, `m5-max-18-32` M5 Max, CPU 18 cœurs, GPU 32 cœurs, `m5-max-18-40` M5 Max, CPU 18 cœurs, GPU 40 cœurs, `m5-ultra-30-64` M5 Ultra, CPU 30 cœurs, GPU 64 cœurs, `m5-ultra-36-80` M5 Ultra, CPU 36 cœurs, GPU 80 cœurs | Les puces proposées sur ce Mac. La bande passante mémoire fixe la vitesse d'écriture, le GPU la vitesse de lecture. |
| Mémoire unifiée | `memory` | 48 Go | `8` 8 Go, `16` 16 Go, `24` 24 Go, `32` 32 Go, `36` 36 Go, `48` 48 Go, `64` 64 Go, `96` 96 Go, `128` 128 Go, `256` 256 Go, `512` 512 Go | Les tailles de mémoire proposées avec cette puce. C'est elle qui décide des modèles qui tiennent : impossible de l'augmenter après l'achat. |

### Modèle

| Paramètre | Clé d'URL | Par défaut | Plage | Description |
|---|---|---|---|---|
| Modèle | `model` | Gemma 4 26B A4B | `llama-3-2-1b` Llama 3.2 1B, `qwen3-5-2b` Qwen3.5 2B, `gemma-4-e2b` Gemma 4 E2B, `llama-3-2-3b` Llama 3.2 3B, `smollm3-3b` SmolLM3 3B, `nemotron-3-nano-4b` Nemotron 3 Nano 4B, `qwen3-5-4b` Qwen3.5 4B, `gemma-4-e4b` Gemma 4 E4B, `llama-3-1-8b` Llama 3.1 8B, `granite-4-2-8b` Granite 4.2 8B, `qwen3-5-9b` Qwen3.5 9B, `gemma-4-12b` Gemma 4 12B, `ministral-3-14b` Ministral 3 14B, `phi-4` Phi-4, `gpt-oss-20b` gpt-oss 20B, `devstral-small-2` Devstral Small 2 24B, `gemma-4-26b-a4b` Gemma 4 26B A4B, `qwen3-8-27b` Qwen3.8 27B, `muse-glimmer-30b` Muse Glimmer 30B, `glm-4-7-flash` GLM-4.7-Flash, `nemotron-3-5-lightning` Nemotron 3.5 Lightning 30B A3B, `gemma-4-31b` Gemma 4 31B, `qwen3-6-35b-a3b` Qwen3.6 35B A3B, `llama-3-3-70b` Llama 3.3 70B, `qwen3-coder-next` Qwen3-Coder-Next, `gpt-oss-120b` gpt-oss 120B, `mistral-small-4` Mistral Small 4 119B, `nemotron-3-super` Nemotron 3 Super 120B A12B, `qwen3-5-122b-a10b` Qwen3.5 122B A10B, `mistral-medium-3-5` Mistral Medium 3.5 128B, `qwen3-8-flash-next` Qwen3.8 Flash Next, `minimax-m2-7` MiniMax M2.7, `deepseek-v4-flash` DeepSeek V4 Flash, `glm-5-3-flash` GLM-5.3-Flash, `qwen3-5-397b-a17b` Qwen3.5 397B A17B, `minimax-m3` MiniMax M3, `deepseek-v3-2` DeepSeek V3.2, `glm-5-3` GLM-5.3, `kimi-k2-6` Kimi K2.6 | Un modèle aux poids ouverts, lancé sur le Mac avec LM Studio, Ollama, llama.cpp ou MLX. Le tableau des résultats montre tous les modèles. |
| Quantification | `quant` | 4 bits | `q3` 3 bits, `q4` 4 bits, `q6` 6 bits, `q8` 8 bits, `full` Original | Le nombre de bits par poids. 4 bits est le choix habituel : environ 3,5 fois plus petit que l'original, pour une petite perte de qualité. 8 bits est presque sans perte. 3 bits, seulement pour les plus gros modèles. |

### Usage

| Paramètre | Clé d'URL | Par défaut | Plage | Description |
|---|---|---|---|---|
| Contexte | `context` | 32 768 tokens | de 512 tokens à 1 048 576 tokens | Les tokens que le modèle garde en mémoire : votre prompt, vos documents, la conversation et la réponse. Un mot français fait environ 1,5 token. Plafonné au maximum du modèle. |
| Moteur | `runtime` | MLX | `mlx` MLX, `llamacpp` llama.cpp | MLX est le framework d'Apple (LM Studio, mlx-lm). llama.cpp lit les fichiers GGUF (Ollama, LM Studio, llama.cpp). MLX est en général un peu plus rapide sur Mac et utilise les Neural Accelerators des puces M5 et M6. |
| Relever la limite mémoire du GPU | `raiseLimit` | false | `true`, `false` | Par défaut, macOS 26 et 27 laissent le GPU utiliser 74 à 91 % de la mémoire selon sa taille (2/3 de 8 Go). La commande sudo sysctl iogpu.wired_limit_mb la relève jusqu'au prochain redémarrage : le simulateur laisse 10 % à macOS, au moins 4 Go. |

## Résultats avec les paramètres par défaut

- Vitesse d'écriture : 83 tok/s
- Prix : 3 809 €
- Écriture, contexte plein : 54 tok/s
- Vitesse de lecture : 2 302 tok/s
- Temps de lecture du contexte : 17 s
- Mémoire nécessaire : 17 Go
- Mémoire utilisable par le GPU : 40 Go
- Modèles qui tiennent : 23
- Bande passante mémoire : 307 Go/s

## Les modèles sur un MacBook Pro 14 pouces (M5 Pro, CPU 18 cœurs, GPU 20 cœurs) avec 48 Go

En 4 bits, avec un contexte de 32 768 tokens (ou le maximum du modèle s'il est plus court). Le GPU peut utiliser 40 Go. Estimations.

| Modèle | Paramètres | Mémoire nécessaire | Écriture | Lecture | Verdict |
|---|---|---|---|---|---|
| Llama 3.2 1B | 1,2 Md | 2,8 Go | 309 tok/s | 10 160 tok/s | Rapide |
| Qwen3.5 2B | 2,3 Md | 3,2 Go | 181 tok/s | 5 786 tok/s | Rapide |
| Gemma 4 E2B | 5,1 Md | 4,9 Go | 179 tok/s | 5 510 tok/s | Rapide |
| Llama 3.2 3B | 3,2 Md | 6,6 Go | 132 tok/s | 3 922 tok/s | Rapide |
| SmolLM3 3B | 3,1 Md | 5,2 Go | 137 tok/s | 4 110 tok/s | Rapide |
| Nemotron 3 Nano 4B | 4 Md | 3,9 Go | 108 tok/s | 3 310 tok/s | Rapide |
| Qwen3.5 4B | 4,7 Md | 5,2 Go | 93 tok/s | 2 809 tok/s | Rapide |
| Gemma 4 E4B | 8 Md | 6,7 Go | 96 tok/s | 2 873 tok/s | Rapide |
| Llama 3.1 8B | 8 Md | 9,9 Go | 55 tok/s | 1 600 tok/s | Rapide |
| Granite 4.2 8B | 8,8 Md | 11 Go | 50 tok/s | 1 455 tok/s | Rapide |
| Qwen3.5 9B | 9,7 Md | 8,2 Go | 46 tok/s | 1 367 tok/s | Rapide |
| Gemma 4 12B | 12 Md | 8,6 Go | 37 tok/s | 1 076 tok/s | Rapide |
| Ministral 3 14B | 14 Md | 15 Go | 32 tok/s | 930 tok/s | Rapide |
| Phi-4 | 14,7 Md | 13 Go | 30 tok/s | 881 tok/s | Rapide |
| gpt-oss 20B | 20,9 Md, 3,6 Md actifs (MoE) | 14 Go | 77 tok/s | 2 483 tok/s | Rapide |
| Devstral Small 2 24B | 24 Md | 22 Go | 19 tok/s | 546 tok/s | Confortable |
| Gemma 4 26B A4B | 25,2 Md, 3,8 Md actifs (MoE) | 17 Go | 83 tok/s | 2 302 tok/s | Rapide |
| Qwen3.8 27B | 27,8 Md | 19 Go | 16 tok/s | 474 tok/s | Confortable |
| Muse Glimmer 30B | 29,6 Md | 21 Go | 16 tok/s | 470 tok/s | Confortable |
| GLM-4.7-Flash | 30 Md, 3 Md actifs (MoE) | 20 Go | 54 tok/s | 2 734 tok/s | Rapide |
| Nemotron 3.5 Lightning 30B A3B | 30 Md, 3 Md actifs (MoE) | 19 Go | 78 tok/s | 2 195 tok/s | Rapide |
| Gemma 4 31B | 30,7 Md | 23 Go | 15 tok/s | 419 tok/s | Confortable |
| Qwen3.6 35B A3B | 35 Md, 3 Md actifs (MoE) | 22 Go | 88 tok/s | 2 183 tok/s | Rapide |
| Llama 3.3 70B | 70,6 Md | 52 Go | – | – | Ne tient pas |
| Qwen3-Coder-Next | 80 Md, 3 Md actifs (MoE) | 47 Go | – | – | Ne tient pas |
| gpt-oss 120B | 116,8 Md, 5,1 Md actifs (MoE) | 66 Go | – | – | Ne tient pas |
| Mistral Small 4 119B | 119,4 Md, 6,5 Md actifs (MoE) | 70 Go | – | – | Ne tient pas |
| Nemotron 3 Super 120B A12B | 120 Md, 12 Md actifs (MoE) | 70 Go | – | – | Ne tient pas |
| Qwen3.5 122B A10B | 122 Md, 10 Md actifs (MoE) | 72 Go | – | – | Ne tient pas |
| Mistral Medium 3.5 128B | 127,7 Md | 91 Go | – | – | Ne tient pas |
| Qwen3.8 Flash Next | 180 Md, 6 Md actifs (MoE) | 114 Go | – | – | Ne tient pas |
| MiniMax M2.7 | 228,7 Md, 10 Md actifs (MoE) | 138 Go | – | – | Ne tient pas |
| DeepSeek V4 Flash | 284 Md, 13 Md actifs (MoE) | 153 Go | – | – | Ne tient pas |
| GLM-5.3-Flash | 320 Md, 18 Md actifs (MoE) | 206 Go | – | – | Ne tient pas |
| Qwen3.5 397B A17B | 397 Md, 17 Md actifs (MoE) | 226 Go | – | – | Ne tient pas |
| MiniMax M3 | 428 Md, 23 Md actifs (MoE) | 249 Go | – | – | Ne tient pas |
| DeepSeek V3.2 | 671 Md, 37 Md actifs (MoE) | 382 Go | – | – | Ne tient pas |
| GLM-5.3 | 744 Md, 40 Md actifs (MoE) | 422 Go | – | – | Ne tient pas |
| Kimi K2.6 | 1 027 Md, 32 Md actifs (MoE) | 581 Go | – | – | Ne tient pas |

## Gemma 4 26B A4B sur chaque puce

| Puce | Mac | Mémoire minimale | Écriture | Lecture | À partir de |
|---|---|---|---|---|---|
| M5 Ultra, CPU 36 cœurs, GPU 80 cœurs | Mac Studio | 96 Go | 152 tok/s | 8 721 tok/s | 8 029 € |
| M5 Ultra, CPU 30 cœurs, GPU 64 cœurs | Mac Studio | 96 Go | 152 tok/s | 6 977 tok/s | 6 599 € |
| M5 Max, CPU 18 cœurs, GPU 40 cœurs | MacBook Pro 14 pouces, MacBook Pro 16 pouces, Mac Studio | 48 Go | 128 tok/s | 4 589 tok/s | 3 659 € |
| M5 Max, CPU 18 cœurs, GPU 32 cœurs | MacBook Pro 14 pouces, MacBook Pro 16 pouces, Mac Studio | 36 Go | 109 tok/s | 3 670 tok/s | 2 999 € |
| M5 Pro, CPU 18 cœurs, GPU 20 cœurs | MacBook Pro 14 pouces, MacBook Pro 16 pouces, Mac mini | 24 Go | 83 tok/s | 2 302 tok/s | 2 219 € |
| M5 Pro, CPU 15 cœurs, GPU 16 cœurs | MacBook Pro 14 pouces, Mac mini | 24 Go | 83 tok/s | 1 838 tok/s | 1 999 € |
| M6, CPU 12 cœurs, GPU 12 cœurs | Mac mini | 24 Go | 53 tok/s | 1 449 tok/s | 1 269 € |
| M5, CPU 10 cœurs, GPU 10 cœurs | MacBook Air 13 pouces, MacBook Air 15 pouces, MacBook Pro 14 pouces | 24 Go | 49 tok/s | 1 123 tok/s | 1 619 € |
| M4, CPU 10 cœurs, GPU 10 cœurs | iMac 24 pouces | 24 Go | 40 tok/s | 307 tok/s | 2 219 € |
| M4, CPU 8 cœurs, GPU 8 cœurs | iMac 24 pouces | 24 Go | 40 tok/s | 246 tok/s | 2 019 € |
| M5, CPU 10 cœurs, GPU 8 cœurs | MacBook Air 13 pouces | Ne tient pas | – | – | – |
| A18 Pro, CPU 6 cœurs, GPU 5 cœurs | MacBook Neo 13 pouces | Ne tient pas | – | – | – |

## Tous les Mac en vente

Prix de départ : Apple Store France, TVA incluse.

| Mac | Puce | CPU | GPU | Bande passante mémoire | Neural Engine | Mémoire | À partir de |
|---|---|---|---|---|---|---|---|
| MacBook Neo 13 pouces | A18 Pro | 6 cœurs | 5 cœurs | 60 Go/s | 16 cœurs | 8 Go | 799 € |
| MacBook Air 13 pouces | M5 | 10 cœurs | 8 cœurs | 153 Go/s | 16 cœurs | 16 Go | 1 399 € |
| MacBook Air 13 pouces | M5 | 10 cœurs | 10 cœurs | 153 Go/s | 16 cœurs | 16 Go, 24 Go, 32 Go | 1 509 € |
| MacBook Air 15 pouces | M5 | 10 cœurs | 10 cœurs | 153 Go/s | 16 cœurs | 16 Go, 24 Go, 32 Go | 1 699 € |
| MacBook Pro 14 pouces | M5 | 10 cœurs | 10 cœurs | 153 Go/s | 16 cœurs | 16 Go, 24 Go, 32 Go | 2 199 € |
| MacBook Pro 14 pouces | M5 Pro | 15 cœurs | 16 cœurs | 307 Go/s | 16 cœurs | 24 Go, 48 Go | 2 899 € |
| MacBook Pro 14 pouces | M5 Pro | 18 cœurs | 20 cœurs | 307 Go/s | 16 cœurs | 24 Go, 48 Go, 64 Go | 3 149 € |
| MacBook Pro 14 pouces | M5 Max | 18 cœurs | 32 cœurs | 460 Go/s | 16 cœurs | 36 Go | 4 799 € |
| MacBook Pro 14 pouces | M5 Max | 18 cœurs | 40 cœurs | 614 Go/s | 16 cœurs | 48 Go, 64 Go, 128 Go | 5 459 € |
| MacBook Pro 16 pouces | M5 Pro | 18 cœurs | 20 cœurs | 307 Go/s | 16 cœurs | 24 Go, 48 Go, 64 Go | 3 399 € |
| MacBook Pro 16 pouces | M5 Max | 18 cœurs | 32 cœurs | 460 Go/s | 16 cœurs | 36 Go | 5 099 € |
| MacBook Pro 16 pouces | M5 Max | 18 cœurs | 40 cœurs | 614 Go/s | 16 cœurs | 48 Go, 64 Go, 128 Go | 5 699 € |
| iMac 24 pouces | M4 | 8 cœurs | 8 cœurs | 120 Go/s | 16 cœurs | 16 Go, 24 Go | 1 799 € |
| iMac 24 pouces | M4 | 10 cœurs | 10 cœurs | 120 Go/s | 16 cœurs | 16 Go, 24 Go | 1 999 € |
| Mac mini | M6 | 12 cœurs | 12 cœurs | 153 à 170 Go/s | 32 cœurs | 16 Go, 24 Go, 32 Go | 1 049 € |
| Mac mini | M5 Pro | 15 cœurs | 16 cœurs | 307 Go/s | 16 cœurs | 24 Go, 48 Go, 64 Go | 1 999 € |
| Mac mini | M5 Pro | 18 cœurs | 20 cœurs | 307 Go/s | 16 cœurs | 24 Go, 48 Go, 64 Go | 2 219 € |
| Mac Studio | M5 Max | 18 cœurs | 32 cœurs | 460 Go/s | 16 cœurs | 36 Go | 2 999 € |
| Mac Studio | M5 Max | 18 cœurs | 40 cœurs | 614 Go/s | 16 cœurs | 48 Go, 64 Go, 128 Go | 3 659 € |
| Mac Studio | M5 Ultra | 30 cœurs | 64 cœurs | 1 228 Go/s | 32 cœurs | 96 Go, 256 Go | 6 599 € |
| Mac Studio | M5 Ultra | 36 cœurs | 80 cœurs | 1 228 Go/s | 32 cœurs | 96 Go, 256 Go, 512 Go | 8 029 € |

## La vitesse d'écriture dépend de la bande passante mémoire

Pour écrire chaque token, le Mac lit une fois tous les poids actifs du modèle. La vitesse d'écriture (decode) est donc à peu près la bande passante mémoire divisée par la taille de ces poids. Une puce M5 Max lit 614 Go par seconde : un modèle dense de 70 milliards de paramètres en 4 bits pèse environ 40 Go, il écrit donc environ 13 tokens par seconde.

Le simulateur utilise 75 à 87 % de la bande passante avec MLX selon la quantification (5 points de moins avec llama.cpp), plus un coût fixe par token mesuré sur chaque type de puce et de modèle. Une longue conversation ralentit tout : chaque nouveau token relit aussi le cache KV, la mémoire du contexte.

## La vitesse de lecture dépend du GPU

Avant de répondre, le modèle lit votre prompt (prefill). Cette étape est limitée par la puissance de calcul : environ 2 opérations par paramètre actif et par token, plus l'attention, qui croît avec le carré de la longueur du prompt.

Les puces M5 et M6 ont un Neural Accelerator dans chaque cœur GPU. MLX s'en sert (macOS 26.2 et suivants) : les prompts sont lus 3,5 à 4 fois plus vite que sur M4. llama.cpp s'en sert depuis avril 2026 pour les produits de matrices, pas encore pour l'attention.

## Ce qui décide si un modèle tient

Les poids, le cache KV et les tampons du moteur doivent tenir dans la mémoire que macOS laisse au GPU. Sur macOS 26 et 27, c'est 74 % de 16 ou 24 Go, 78 % de 32 à 48 Go, 81 % de 64 ou 96 Go, 84 % de 128 Go, 87 % de 256 Go et 464 Go sur 512 Go. La commande sudo sysctl iogpu.wired_limit_mb la relève jusqu'au prochain redémarrage.

Les tailles de mémoire d'Apple sont binaires : 16 Go font 17,2 milliards d'octets. Les tailles des modèles sont ici en milliards d'octets, comme sur Hugging Face.

## Quantification et mélanges d'experts

La quantification stocke chaque poids sur moins de bits. 4 bits est le choix habituel : le modèle est 3,5 fois plus petit qu'en 16 bits et perd peu en qualité. 8 bits est presque sans perte. Un gros modèle en 4 bits fait en général mieux qu'un petit en 8 bits.

Un mélange d'experts (MoE) comme gpt-oss, Qwen3.6 35B A3B ou DeepSeek n'utilise que quelques experts par token. Tous ses poids doivent tenir en mémoire, mais chaque token ne lit que les poids actifs : gpt-oss 120B demande 65 Go et écrit comme un modèle de 5 milliards de paramètres.

## La fiabilité des chiffres

Les constantes viennent d'environ 300 mesures publiées : le fil de benchmarks de llama.cpp, les résultats MLX et oMLX, les chiffres d'Apple et les tests des Mac M5 et M6. Les estimations sont en général à moins de 15 % d'une mesure faite avec le même logiciel. Votre vitesse dépend de l'application, de sa version et de ses réglages : Ollama, LM Studio et llama.cpp n'utilisent pas tous le même moteur.

Les prix sont ceux de l'Apple Store de la devise choisie au 1er octobre 2026, avec le stockage de base. Apple les a augmentés le 25 juin 2026. En France (et au Royaume-Uni pour les MacBook Air et Pro), les MacBook sont vendus sans adaptateur secteur. Le Mac Studio avec 512 Go arrive fin octobre 2026 : son prix n'est pas encore publié.

## Questions fréquentes

### Quel Mac pour faire tourner gpt-oss 120B ?

Plus de 64 Go de mémoire : il lui faut environ 66 Go et les Mac de 64 Go laissent 56 Go au GPU. Le moins cher est le Mac Studio M5 Max avec 128 Go (5 859 €), à environ 89 tokens par seconde. Le MacBook Pro M5 Max avec 128 Go va aussi vite. Le Mac Studio M5 Ultra avec 96 Go (6 599 €) en écrit environ 113.

### Combien de mémoire pour un modèle de 70 milliards de paramètres ?

Llama 3.3 70B en 4 bits demande environ 40 Go de poids, plus 11 Go de cache KV pour un contexte de 32 768 tokens. Un Mac de 64 Go le fait tourner, lentement : environ 6 tokens par seconde sur une puce M5 Pro, 13 sur une M5 Max. Une M5 Ultra (96 Go minimum) en écrit environ 23.

### Un MacBook Neo ou un MacBook Air peut-il faire tourner un LLM en local ?

Oui, des petits. Le MacBook Neo a 8 Go : des modèles jusqu'à 4 milliards de paramètres, comme Qwen3.5 4B à environ 19 tokens par seconde. Un MacBook Air de 16 Go fait tourner des modèles jusqu'à 14 milliards (Phi-4 à environ 15 tokens par seconde, Llama 3.1 8B à environ 28). Ils n'ont pas de ventilateur : les longs prompts ralentissent quand la puce chauffe.

### MLX ou llama.cpp (Ollama, LM Studio) ?

Sur Mac, MLX est en général un peu plus rapide. Il est bien plus rapide sur les modèles hybrides comme Qwen3.5 et Qwen3.6 (1,4 à 1,9 fois), et il lit les prompts plus vite sur M5 et M6. LM Studio fait tourner les deux. Ollama fait tourner certains modèles sur MLX et les autres sur llama.cpp.

### Pourquoi un modèle de 35 milliards va-t-il plus vite qu'un de 8 milliards ?

Parce que c'est un mélange d'experts. Qwen3.6 35B A3B n'utilise que 3 milliards de paramètres par token : avec MLX, il écrit plus vite qu'un modèle dense de 8 milliards, mais ses 35 milliards de paramètres doivent tous tenir en mémoire.

### Peut-on faire tourner DeepSeek ou Kimi sur un Mac ?

DeepSeek V4 Flash, oui : en 4 bits il demande environ 150 Go et tourne sur un Mac Studio M5 Ultra de 256 Go, à environ 48 tokens par seconde. DeepSeek V3.2 et Kimi demandent le Mac Studio M5 Ultra avec 512 Go, qui arrive fin octobre 2026. DeepSeek V3.2 en 4 bits demande environ 380 Go et écrit environ 25 tokens par seconde. Kimi K2.6 (1 000 milliards de paramètres) ne tient qu'en 3 bits.

### Mes réglages sont-ils envoyés quelque part ?

Non. Les calculs se font dans votre navigateur. Rien n'est envoyé tant que vous ne cliquez pas sur Enregistrer ou Partager.

## L'ouvrir avec vos propres chiffres

Chaque paramètre peut être passé dans l'URL, avec les clés ci-dessus. La même URL avec « .md » (par exemple /fr/simulateur.md?cle=valeur) renvoie les résultats calculés pour ces paramètres. Un lien de partage (/fr/simulateur/<identifiant>) a lui aussi sa version .md ; un lien avec « #s= » ne peut pas être lu par un serveur : demandez le lien de partage. Par exemple :

https://simulkit.com/fr/mac-llm-local?model=llama-3-2-1b&mac=macbook-neo
