Quel mini-PC pour faire tourner des LLM en local en 2026 ?
Faire tourner un LLM chez soi n'a plus rien d'exotique : Ollama ou LM Studio s'installent en quelques minutes, et des modèles ouverts comme Qwen, Mistral, Llama ou GPT-OSS rivalisent avec les API payantes sur beaucoup de tâches. La vraie question est matérielle. Et sur ce terrain, un critère écrase tous les autres : la quantité de mémoire que le GPU peut utiliser, et la vitesse à laquelle il la lit.
Ce comparatif ne repose pas sur des tests maison : c'est une sélection construite à partir des fiches techniques des constructeurs et des tests publiés, lue avec notre expérience d'exploitation de modèles locaux sur nos propres serveurs.
La règle à retenir avant d'acheter
Un modèle quantifié en 4 bits occupe environ 0,6 Go de mémoire par milliard de paramètres, plus de la place pour le contexte :
| Taille du modèle | Mémoire nécessaire (Q4, ordre de grandeur) | Exemples | |---|---|---| | 7 à 8 milliards | 5 à 6 Go | Llama 3.1 8B, Qwen 2.5 7B | | 14 milliards | 9 à 10 Go | Qwen 2.5 14B, Phi-4 | | 30 à 32 milliards | 18 à 22 Go | Qwen3 30B, QwQ 32B | | 70 milliards | 40 à 45 Go | Llama 3.3 70B | | 120 milliards (MoE) | 60 à 65 Go | GPT-OSS 120B |
La quantité de mémoire décide donc quels modèles tournent. La bande passante mémoire décide à quelle vitesse ils répondent (en tokens par seconde). Les machines ci-dessous ont toutes une mémoire unifiée, partagée entre processeur et GPU, ce qui évite le plafond de VRAM d'une carte graphique classique.
Apple Mac mini M4 (16 Go) — le point d'entrée le plus simple
Puce M4 · CPU 10 cœurs · GPU 10 cœurs · 16 Go de mémoire unifiée · 120 Go/s · SSD 256 Go
La façon la moins chère et la plus silencieuse de découvrir les LLM locaux. Ollama et LM Studio tournent nativement sur Apple Silicon, sans pilote à installer. Avec 16 Go, les modèles de 7-8 milliards de paramètres tournent confortablement, et les 14 milliards passent avec un contexte raisonnable.
- Pour qui : découvrir les LLM locaux, un assistant de code ou de rédaction léger, des agents simples.
- Limite : macOS réserve une partie de la mémoire au système ; au-delà de 14B, ça coince. La mémoire n'est pas extensible après achat.
Voir le Mac mini M4 (16 Go) sur Amazon
Apple Mac mini M4 Pro (24 Go) — le compromis silencieux
Puce M4 Pro · CPU 12 cœurs · GPU 16 cœurs · 24 Go de mémoire unifiée · 273 Go/s · SSD 512 Go
Plus de deux fois la bande passante du M4 : à modèle égal, les réponses arrivent nettement plus vite. Les 24 Go ouvrent les modèles de 14B avec un long contexte, et les 30B quantifiés de façon agressive, au prix d'une marge mémoire faible.
- Pour qui : un usage quotidien sérieux (assistant de code local, RAG sur ses documents) dans un boîtier de 13 cm, quasi inaudible.
- Limite : la configuration 24 Go plafonne vite pour les modèles de 30B et plus ; les versions avec davantage de mémoire coûtent cher chez Apple.
Voir le Mac mini M4 Pro (24 Go) sur Amazon
GMKtec EVO-X2 (Ryzen AI Max+ 395, 128 Go) — pour les gros modèles
AMD Ryzen AI Max+ 395 · 16 cœurs / 32 threads · GPU Radeon 8060S (40 CU) · 128 Go LPDDR5X-8000 · ~256 Go/s · SSD 2 To
C'est la catégorie qui a changé la donne en 2025-2026 : la puce « Strix Halo » d'AMD permet d'allouer jusqu'à 96 Go de mémoire au GPU. Résultat, un boîtier de bureau fait tourner un modèle de 70B ou GPT-OSS 120B, ce qui demandait auparavant plusieurs cartes graphiques. L'EVO-X2 est le modèle de cette famille le plus testé par la presse spécialisée, et il garde deux emplacements M.2 pour étendre le stockage.
- Pour qui : faire tourner les plus gros modèles ouverts, servir un LLM à toute la maison ou au bureau, expérimenter avec plusieurs modèles chargés en même temps.
- Limites : bruyant sous charge comparé à un Mac, consommation de l'ordre de 120 à 140 W en pointe, et un écosystème logiciel AMD (ROCm, Vulkan) un peu moins clé en main que Metal sur Mac. Les prix ont fortement augmenté en 2026 avec la flambée de la mémoire vive : comparez avant d'acheter.
Voir le GMKtec EVO-X2 128 Go sur Amazon
Même puce, autres boîtiers : le Beelink GTR9 Pro (deux ports Ethernet 10 Gbit/s, utile pour en faire un serveur) et le Minisforum MS-S1 Max (refroidissement plus généreux) partagent le même processeur et donc des performances d'inférence très proches. Le choix se joue sur la connectique, le bruit et le prix du moment.
Lequel choisir ?
| Votre usage | Notre choix | |---|---| | Découvrir Ollama, modèles jusqu'à 8-14B | Mac mini M4 (16 Go) | | Assistant quotidien rapide et silencieux, jusqu'à 14B avec long contexte | Mac mini M4 Pro (24 Go) | | Modèles de 70B, GPT-OSS 120B, plusieurs modèles en parallèle | GMKtec EVO-X2 (128 Go) | | Serveur LLM pour un réseau local rapide | Beelink GTR9 Pro |
Questions fréquentes
Un mini-PC remplace-t-il une API comme Claude ou GPT ? Pas complètement. Les meilleurs modèles fermés restent devant sur le raisonnement complexe. Un LLM local excelle en revanche pour les tâches répétitives, les données confidentielles qui ne doivent pas sortir de chez vous, et les volumes où la facture d'API grimperait vite.
Faut-il privilégier la mémoire ou la puissance de calcul ? La mémoire, sans hésiter. Un modèle qui ne tient pas en mémoire ne tourne pas, ou tourne de façon inutilisable. À mémoire égale, regardez ensuite la bande passante.
Peut-on ajouter de la mémoire plus tard ? Non, sur aucune de ces machines : la mémoire unifiée est soudée. Achetez directement la capacité correspondant aux modèles que vous visez.
Et un PC avec une carte graphique NVIDIA ? C'est l'option la plus rapide pour les modèles qui tiennent dans la VRAM de la carte (16 à 32 Go sur les cartes grand public). Au-delà, le modèle déborde sur la mémoire système et les performances s'effondrent : c'est précisément là que la mémoire unifiée de ces mini-PC prend l'avantage.
Liens partenaires : si vous achetez via ces liens Amazon, NextOptimus peut percevoir une commission, sans surcoût pour vous. Les prix et la disponibilité évoluent : vérifiez-les sur la page Amazon au moment de l'achat.