Aller au contenu principal

GEEKOM a relié quatre mini PC entre eux sur son stand de l’IFA 2026 pour faire tourner un modèle de langage en local, sans passer par le moindre serveur. La démonstration est spectaculaire, et elle pose la seule question qui intéresse vraiment l’acheteur : à partir de quelle machine, et de combien de mémoire, une IA locale devient-elle utilisable au quotidien ? Nous avons repris les quinze mini PC testés sur Daily Geek Show depuis deux ans GEEKOM, GMKtec, NiPoGi, Tivique et confronté chacun à ce qu’il peut réellement charger. Verdict court : la barrière n’est ni le processeur ni le NPU, c’est la mémoire. Et une machine sur trois vendue avec l’étiquette « IA » a une mémoire soudée qui l’empêchera d’aller plus loin, pour toujours.

Le calcul est presque décevant tant il est simple. Un modèle de langage doit tenir en mémoire pour être exécuté. Pas partiellement, pas « en streaming » : entièrement, poids compris. Dès qu’il déborde, le système bascule sur le disque et les performances s’effondrent d’un facteur dix à cinquante. C’est cette contrainte, et non la puissance de calcul brute, qui décide si votre machine fait tourner un assistant fluide ou un générateur de texte au rythme d’une machine à écrire des années 1970.

La deuxième variable, moins connue, tient à la quantification. Un modèle brut stocke chaque paramètre sur 16 bits. En le compressant à 4 bits la quantification Q4, devenue le standard de fait sur les machines grand public — on divise l’empreinte mémoire par quatre pour une perte de qualité que la plupart des usages ne perçoivent pas. C’est ce qui a rendu l’IA locale possible ailleurs que dans un datacenter, et c’est ce qui explique pourquoi un mini PC à moins de 600 € peut faire ce qui demandait une carte graphique professionnelle il y a trois ans.

Nous testons ces machines depuis deux ans, du GEEKOM AX8 Pro AI au GMKtec K8 Plus, en passant par le NucBox K17 et le NiPoGi AM06 Pro. Ce dossier prend la suite sous un angle différent : non pas quelle machine acheter, mais ce que chacune de celles que nous avons eues entre les mains peut réellement exécuter.

Combien de mémoire pour quel modèle : le tableau de référence

Voici l’empreinte mémoire réelle des modèles courants, en tenant compte de la surcharge d’exécution (10 à 15 % au-delà du poids brut des paramètres). Les valeurs Q4 correspondent à ce que tout le monde utilise en pratique ; les valeurs Q8 servent de référence pour ceux qui veulent une qualité supérieure et ont la mémoire pour.

Taille du modèleMémoire en Q4Mémoire en Q8Ce qu’il sait faire
3 B~2,2 Go~3,5 GoRésumé, reformulation, classement de texte
7 B~4,5 Go~7,5 GoAssistant généraliste correct, code simple
8 B~5,0 Go~8,5 GoLe meilleur rapport qualité/mémoire actuel
13 B~8,5 Go~14 GoRaisonnement plus tenu, textes longs
34 B~20 Go~36 GoCode sérieux, analyse de documents
70 B~42 Go~74 GoProche des services en ligne d’il y a un an

La formule sous-jacente tient en une ligne : (nombre de paramètres en milliards × bits par poids) ÷ 8, plus 10 à 15 % de surcharge. Un 13 B en Q4 donne (13 × 4) ÷ 8 = 6,5 Go de poids, arrondis à 8,5 Go une fois le contexte et les tampons pris en compte. Vous pouvez appliquer ce calcul à n’importe quel modèle qui sortira dans les six prochains mois.

Un point que les fiches produit passent systématiquement sous silence : le cache d’attention. Il grossit avec la longueur de la conversation. Sur un 70 B avec une fenêtre de 32 000 tokens l’équivalent d’une soixantaine de pages —, il peut ajouter 8 Go à lui seul. Autrement dit, les 42 Go du tableau sont un plancher pour une conversation courte, pas un budget confortable. Prévoyez 15 % de marge si vous comptez travailler sur des documents longs.

Mémoire unifiée ou VRAM dédiée : la vraie ligne de partage

C’est le point technique qui décide de tout, et celui que les revendeurs expliquent le plus mal. Sur un PC classique avec carte graphique dédiée, la mémoire est cloisonnée : 32 Go de RAM système d’un côté, 8 ou 12 Go de VRAM de l’autre. Un modèle qui dépasse la VRAM déborde vers la RAM en passant par le bus PCIe, avec la chute de débit que cela implique.

Sur les puces à mémoire unifiée c’est le cas des Ryzen AI Max de la dernière génération comme des puces Apple, le processeur et la partie graphique puisent dans le même pool. Une machine avec 64 Go unifiés peut en allouer 48 au modèle. C’est mathématiquement ce qui permet à un mini PC de 15 centimètres de côté d’exécuter un 70 B là où une tour équipée d’une carte graphique à 900 € plafonne à un 13 B.

L’inconvénient est réel et rarement mentionné : la bande passante mémoire d’une puce unifiée reste inférieure à celle d’une VRAM dédiée haut de gamme. Vous chargez un modèle plus gros, mais il tourne moins vite qu’il ne le ferait sur une carte graphique capable de l’accueillir. En pratique, sur un usage assistant écrire, résumer, reformuler, la différence se sent peu. Sur de la génération d’images ou du traitement par lots, elle se sent beaucoup.

Le piège de la mémoire soudée

C’est la limite que nous avons rencontrée sur le terrain et qui ne figure sur aucune fiche marketing. Les plateformes Intel Lunar Lake les plus récentes celles précisément vendues comme des machines IA intègrent la mémoire directement dans le boîtier du processeur. Sur le GMKtec K13 comme sur le NucBox K17, les 16 Go de LPDDR5X sont soudés et non extensibles. Définitivement.

Le paradoxe est saisissant. Le K13 revendique 115 TOPS de calcul IA cumulés NPU, partie graphique et processeur confondus. Le K17 en revendique 97. Sur le papier, ce sont les machines les plus « IA » de notre parc de test. En pratique, leurs 16 Go les enferment à un modèle 8 B, quand un GMKtec K8 Plus sorti avant eux, sans NPU vedette et avec des barrettes DDR5 classiques, monte à 96 Go et donc à un modèle 70 B moyennant une centaine d’euros de mémoire supplémentaire.

Une machine à 650 € avec un NPU spectaculaire plafonne donc plus bas qu’une machine du même prix sans NPU du tout. C’est contre-intuitif, c’est vrai, et c’est le genre de détail qu’on ne découvre qu’en ouvrant le châssis. Avant d’acheter une machine pour l’IA locale, la question à poser n’est pas « combien de TOPS » mais « la mémoire est-elle soudée ».

Les mini PC testés par DGS face aux modèles de langage

Nous avons repris les machines passées entre nos mains depuis deux ans et calculé, pour chacune, ce qu’elle peut charger en configuration d’usine puis après extension mémoire quand celle-ci est possible. Les configurations varient selon les références commercialisées : les valeurs ci-dessous correspondent aux versions les plus courantes sur Amazon France début septembre 2026.

MachineProcesseurMémoireModèle max en Q4Notre testVoir
GEEKOM A9 MegaRyzen AI Max+ 395128 Go unifiés70 B confortableÀ venirAmazon
GMKtec Evo-X2Ryzen AI Max+ 395128 Go unifiés70 B confortableNon testéAmazon
GMKtec Evo-X2 (64 Go)Ryzen AI Max+ 39564 Go unifiés70 B en limite, 34 B confortableNon testéAmazon
GEEKOM A9 Mega (variante)Ryzen AI Max+ 38864 Go unifiés70 B en limite, 34 B confortableÀ venirAmazon
GMKtec K8 PlusRyzen 7 8845HS32 Go DDR5, extensible 96 Go34 B — 70 B après extensionTest DGSAmazon
GEEKOM A9 MaxRyzen AI 9 HX 37032 Go DDR534 BAmazon
GEEKOM AX8 Pro AIRyzen 9 8945HS32 Go DDR534 BTest DGSAmazon
GEEKOM A8Ryzen 9 8945HS32 Go DDR534 BTest DGSAmazon
GEEKOM AE8Ryzen 9 8945HS32 Go DDR534 BTest DGSAmazon
NiPoGi AM06 ProRyzen 7 7730U32 Go DDR413 B confortable, 34 B en limiteTest DGSAmazon
NiPoGi AM06 Pro (5825U)Ryzen 7 5825U32 Go DDR413 BTest DGSAmazon
GEEKOM A7Ryzen 9 7940HS16 à 32 Go DDR513 B à 34 BTest DGSAmazon
GEEKOM A8 (entrée)Ryzen 7 8745HS16 Go, extensible 128 Go13 B — 70 B après extensionTest DGSAmazon
GMKtec K13Core Ultra 7 256V — 115 TOPS16 Go LPDDR5X soudée8 B — plafond définitifTest DGSAmazon
GMKtec NucBox K17Core Ultra 5 226V — 97 TOPS16 Go LPDDR5X soudée8 B — plafond définitifTest DGSAmazon
GMKtec G11Ryzen Embedded R251416 Go DDR4, extensible 32 Go8 B — 13 B après extensionTest DGSAmazon
GEEKOM A5 ProRyzen 7 5825U / 7730U16 Go DDR413 B (lent)Test DGSOffres
NiPoGi AM06 Pro (entrée)Ryzen 5 7430U16 Go DDR48 BTest DGSAmazon
NiPoGi Hyper H2Intel Core i5/i716 Go8 BTest DGSAmazon
Tivique 16 poucesIntel Core i716 Go8 BTest DGSAmazon
NiPoGi E3BIntel N-series16 Go8 B (usage léger)Test DGSAmazon
NiPoGi AK1 PlusIntel N95 / N1008 à 16 Go3 B à 7 BTest DGSAmazon

La plupart de ces machines nous ont été prêtées par les marques dans le cadre de partenariats test, et notre analyse reste indépendante c’est d’ailleurs ce qui nous permet d’écrire qu’une machine à 16 Go de mémoire soudée étiquetée « IA » ne fera pas ce que sa fiche laisse espérer.

Ce tableau appelle une lecture qui va à l’encontre du discours commercial ambiant. La colonne processeur est presque décorative : un Ryzen 9 8945HS avec 16 Go plafonne exactement au même endroit qu’un Ryzen 5 avec 16 Go. Le NPU intégré, dont les marques font désormais un argument de vente, n’entre pas en jeu sur la plupart des exécutions locales actuelles, qui s’appuient sur le processeur et la partie graphique. Il sert à l’accélération de fonctions Windows et à quelques applications spécialisées, pas à faire tourner votre assistant.

Le classement qui compte n’est pas celui des puces mais celui des trois familles de mémoire. En haut, les machines à mémoire unifiée de 64 à 128 Go : GEEKOM A9 Mega et GMKtec Evo-X2, seules à ouvrir la porte du 70 B. Au milieu, les machines à barrettes SO-DIMM, extensibles, donc évolutives : GMKtec K8 Plus, GEEKOM A8, NiPoGi AM06 Pro. En bas, les machines à mémoire soudée de 16 Go, verrouillées à vie, quel que soit leur nombre de TOPS.

GEEKOM à l’IFA, GMKtec déjà en rayon

Sur son stand du hall 6.2, GEEKOM a relié quatre A9 Mega par USB4 pour répartir la charge d’un modèle de grande taille sur les quatre machines. L’intérêt de la démonstration n’est pas le nombre de machines mais ce qu’il implique : le goulot d’étranglement de l’IA locale se déplace de la puissance de calcul vers la capacité mémoire agrégée, et l’USB4 offre assez de bande passante pour rendre le partage viable.

La configuration présentée s’articule autour du Ryzen AI Max+ 395 en 16 cœurs et 32 threads, associé à une partie graphique Radeon 8060S et à 128 Go de mémoire unifiée avec 2 To de stockage. Une variante bâtie sur le Max+ 388 avec 64 Go unifiés et un SSD Phison orienté IA revendique la capacité à faire tourner un modèle de 70 milliards de paramètres ce qui correspond exactement à nos 42 Go de tableau, avec la marge de contexte en plus. Les tarifs français annoncés démarrent à 2 399 €.

Un détail que les reprises de communiqué ne mentionneront pas : GMKtec vend depuis plusieurs mois l’Evo-X2, bâti sur exactement la même puce Ryzen AI Max+ 395, avec la même partie graphique Radeon 8060S et jusqu’à 128 Go de mémoire unifiée, disponible sur Amazon France en configurations 64, 96 et 128 Go. Autrement dit, l’annonce GEEKOM n’ouvre pas une catégorie, elle y entre. Pour l’acheteur c’est une bonne nouvelle : deux constructeurs sur le même silicium, c’est une pression tarifaire qui n’existait pas il y a six mois.

Le reste de l’annonce mérite d’être trié. Le GeekBook X16 Pro, un portable 16 pouces en magnésium à 1,27 kg, n’est pour l’instant pas distribué en Europe. Le Mega Mini PC IT13, autour d’un Core Ultra X7 358H seize cœurs avec une partie graphique Arc B390 et un NPU dédié, représente la réponse Intel à la même problématique — avec la question de la mémoire soudée qui se posera pour lui aussi. Et l’A5 Edition 2027, reconduite sur un Ryzen 7 7730U, montre que l’entrée de gamme reste sur des bases de 2023 : à ce niveau de prix, l’IA locale n’est pas l’argument.

La vitesse, l’autre chiffre qu’on ne vous donne jamais

Charger un modèle et l’utiliser confortablement sont deux choses différentes. La mesure qui compte s’appelle le débit en tokens par seconde. En dessous de 5 tokens par seconde, l’attente devient pénible pour une conversation. Autour de 15, c’est fluide. Au-delà de 30, vous lisez moins vite que la machine n’écrit.

L’ordre de grandeur à retenir, sur les architectures à mémoire partagée de type mini PC : un modèle 7 ou 8 B tourne très correctement, un 13 B reste utilisable, un 34 B devient lent mais exploitable pour du travail asynchrone vous lancez une analyse et vous revenez dans deux minutes, un 70 B relève du traitement par lots plutôt que de la conversation. Ces valeurs dépendent fortement du modèle exact, du moteur d’inférence et de la longueur du contexte, et nous les publierons machine par machine lorsque nous aurons mesuré sur nos propres exemplaires.

Détail pratique que personne ne mentionne : le temps de premier chargement. Un 34 B en Q4 pèse une vingtaine de gigaoctets à lire depuis le SSD. Sur un NVMe correct, comptez une vingtaine de secondes avant la première réponse. Sur un SSD d’entrée de gamme saturé, ce peut être une minute. C’est là que le stockage rapide sert vraiment, bien plus que sur le reste de l’usage bureautique.

Le bruit et la chaleur, jamais dans les fiches

Une inférence longue met le processeur à contribution de façon continue, ce qu’aucun usage bureautique ne fait. Sur les châssis compacts, la ventilation passe en régime soutenu et y reste. C’est audible dans une pièce calme proche du bruit d’un ordinateur portable en compilation, pas d’un aspirateur, mais présent en continu pendant plusieurs minutes.

Sur les machines à châssis très fin, l’échauffement finit par déclencher une réduction de fréquence. Le modèle continue de fonctionner, le débit baisse. C’est une limite qui ne figure sur aucune fiche technique, et qui explique pourquoi deux machines aux caractéristiques identiques sur le papier ne donnent pas le même confort d’usage réel sur une session de travail d’une heure.

Pour qui l’IA locale a du sens

Le profil idéal est celui qui traite des documents qui ne doivent pas sortir de chez lui : dossiers clients, contrats, notes internes. Un cabinet, un indépendant soumis au secret professionnel, une petite structure qui refuse d’envoyer ses données à un service américain. Là, une machine à 32 Go extensibles autour de 600 à 750 € couvre le besoin avec un modèle 13 B, et laisse la porte ouverte à un 70 B plus tard pour le prix de deux barrettes.

Le profil compatible avec réserves est le développeur ou le rédacteur qui veut un assistant sans abonnement. Cela fonctionne, mais il faut accepter qu’un 13 B local reste en dessous des services en ligne actuels sur le raisonnement complexe. Le bon usage est l’assistance quotidienne reformuler, résumer, générer du code standard, pas la résolution de problèmes difficiles.

Le profil pour qui c’est le mauvais choix : celui qui achète une machine à 16 Go soudés étiquetée « IA » en pensant obtenir l’équivalent d’un service en ligne. Il obtiendra un modèle 8 B, correct pour le résumé, décevant pour tout le reste, et sans aucune possibilité d’évoluer. Il en conclura que l’IA locale ne marche pas. Le problème ne sera pas la technologie, il sera la fiche produit qui lui aura vendu 115 TOPS en laissant croire que c’était la pièce déterminante.

Par où commencer concrètement

Deux outils couvrent aujourd’hui l’essentiel des besoins. Ollama fonctionne en ligne de commande et se pilote ensuite depuis n’importe quelle interface web ; c’est le choix de ceux qui veulent automatiser. LM Studio propose une interface graphique complète avec un catalogue de modèles téléchargeables en un clic, et affiche pour chacun s’il tient dans votre mémoire ce qui évite justement l’erreur que ce dossier cherche à prévenir.

Le premier réflexe utile consiste à télécharger un modèle 8 B en Q4, quelle que soit votre machine, et à mesurer votre propre débit avant d’aller plus haut. Si un 8 B tourne à 20 tokens par seconde chez vous, un 13 B tournera autour de 12 et un 34 B autour de 4. Ce rapport est stable et vous évite trois téléchargements de plusieurs dizaines de gigaoctets pour rien.

Questions fréquentes

Quelle quantité de RAM faut-il pour faire tourner une IA en local ?

Comptez 8 Go minimum pour un modèle 7 ou 8 B en quantification Q4, qui couvre le résumé et la reformulation. 32 Go permettent un modèle 13 B confortable et un 34 B en limite. Pour un 70 B, il faut 64 Go au minimum, idéalement en mémoire unifiée.

Un mini PC peut-il remplacer ChatGPT ?

Pour le résumé, la reformulation et le code courant, oui, avec un modèle 13 B et 32 Go de mémoire. Pour le raisonnement complexe et les tâches longues, non : les modèles exécutables sur une machine grand public restent en retrait des services en ligne actuels. L’avantage est la confidentialité et l’absence d’abonnement, pas la performance.

Le NPU sert-il vraiment à faire tourner un modèle de langage ?

Rarement en pratique. La plupart des moteurs d’inférence grand public s’appuient sur le processeur et la partie graphique intégrée, pas sur le NPU. Celui-ci accélère certaines fonctions système et applications spécialisées. Un NPU de 115 TOPS sur une machine à 16 Go ne compense en rien le manque de mémoire.

Faut-il éviter les mini PC à mémoire soudée pour l’IA locale ?

Oui, si l’IA locale est votre usage principal. Les plateformes Intel Lunar Lake comme le GMKtec K13 ou le NucBox K17 intègrent 16 Go non extensibles : le plafond est définitif, quel que soit le nombre de TOPS annoncé. Une machine à barrettes SO-DIMM peut monter à 96 Go plus tard.

GEEKOM A9 Mega ou GMKtec Evo-X2 ?

Les deux reposent sur le même Ryzen AI Max+ 395 avec partie graphique Radeon 8060S et mémoire unifiée jusqu’à 128 Go. Leurs capacités en IA locale sont donc équivalentes. Le choix se fait sur le prix du moment, la connectique et le service après-vente, pas sur la performance en inférence.

Quelle est la différence entre Q4 et Q8 ?

Q4 compresse chaque paramètre sur 4 bits, Q8 sur 8. Q8 occupe environ 70 % de mémoire en plus pour un gain de qualité modeste sur la plupart des usages. Q4 est le standard de fait sur les machines grand public et le bon point de départ.

Combien coûte un mini PC capable de faire tourner un modèle 13 B ?

Une machine avec 32 Go de mémoire se trouve entre 400 et 800 € selon la génération de processeur. Le supplément mémoire est le poste sur lequel il ne faut pas économiser : une extension de 16 à 32 Go coûte moins cher que le changement de machine qu’elle évite.

Verdict

L’IA locale sur mini PC est passée du bricolage à l’usage réel, et le déclencheur n’est pas l’arrivée des NPU mais la généralisation de la mémoire unifiée en grande quantité. La démonstration de GEEKOM à l’IFA le confirme à sa manière : ce que la marque met en avant, ce n’est pas la puissance de calcul de ses machines, c’est le fait d’en agréger la mémoire. Et le fait que GMKtec vende déjà la même puce avec la même quantité de mémoire montre que la course se joue désormais sur ce terrain-là.

Pour l’acheteur, la conséquence est directe et un peu ingrate. La question n’est plus « quel processeur » mais « combien de gigaoctets, unifiés ou non, et soudés ou non ». Une machine à 32 Go de 2023 fera tourner exactement les mêmes modèles qu’une machine à 32 Go de 2026, en un peu moins vite. Le saut de génération ne se justifie que si vous montez en mémoire ou si vous passez à l’unifié.

Recommandé si vous traitez des données qui ne doivent pas quitter votre poste, si vous voulez un assistant sans abonnement pour des tâches de rédaction quotidiennes, ou si vous voulez apprendre le fonctionnement réel de ces modèles. Dans ces trois cas, une machine à 32 Go extensibles autour de 700 € est le point d’entrée raisonnable, et le GMKtec K8 Plus reste la meilleure porte d’entrée évolutive de notre parc de test.

Déconseillé si vous cherchez à égaler un service en ligne sur des tâches complexes, si votre budget vous limite à 16 Go, ou si vous comptez sur le NPU annoncé sur la boîte pour compenser. On espérait davantage de transparence de la part des constructeurs sur ce dernier point : vendre 115 TOPS sur une machine dont la mémoire est soudée à 16 Go, c’est promettre une capacité que le matériel ne peut pas tenir, et ça va produire beaucoup de déceptions cette année.

Par Antoine - Daily Geek Show, le

Étiquettes: , , ,

Catégories: , , , ,

Partager cet article

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *