IAboutique

L'IA locale pour tous les budgets

Quel PC pour l'IA locale selon votre budget ?

Premier assistant personnel ou infrastructure d'équipe : il existe une machine IAboutique pour chaque budget. Ce guide regroupe les configurations par tranche, indique les modèles que chacune peut exécuter, et pour qui c'est fait. Les prix affichés sont TTC, mis à jour en continu, machine prête à l'emploi installée et testée à la livraison.

Comment lire ce guide

Les tranches budgétaires expliquées

Chaque machine ci-dessous est livrée complète et prête à l'emploi: système d'exploitation, Ollama ou vLLM, interface web, benchmark signé au déballage. Les prix sont TTC et suivent automatiquement notre catalogue — ce que vous voyez ici est ce que vous verrez sur la fiche.

Les quatre tranches couvrent quatre niveaux de puissance: du chat et de la rédaction légère jusqu'aux modèles de 405 milliards de paramètres utilisables par une équipe entière. Chaque échelon augmente la taille des modèles accessibles et le confort d'usage — mais le coût ne suit pas linéairement.

Moins de 3 000 €

Le starter : assistant local personnel

À ce budget, vous avez accès à un assistant personnel IA local : chat, rédaction, résumés, questions-réponses sur le quotidien. Les modèles vedettes ici : LLaMA 8B et Mistral 7B — légèreté et efficacité. Rien ne sort de votre machine.

PRO 32B

Interrogez vos dossiers pro en langage naturel.

2 645,99 €

Modèles : Qwen3 32B, Mistral Small 24B, RAG documentaire

PME et indépendants qui veulent interroger leurs dossiers.

3 000 à 8 000 €

Le professionnel léger : 32B local et RAG

Ici commence le sérieux : modèles de 14 à 32 milliards de paramètres, le niveau où l'IA manie des nuances, des documents longs, du RAG (branchement de vos fichiers). Idéal pour PME, petites équipes, consultants — Qwen 32B, Mistral Small 24B, Phi-4.

STARTER 8B

Votre premier assistant IA, 100 % privé.

3 076,75 €

Modèles : Llama 3.1 8B, Mistral 7B

Indépendants et TPE qui débutent avec l'IA.

CREATOR 14B

Texte, code et génération d'images en local.

3 182,37 €

Modèles : Qwen3 14B, Phi-4, SDXL / Flux (images)

Créatifs et studios qui génèrent textes et images.

EVO-X3 70B

EXPERT 70B avec extension GPU externe — la flexibilité du mini-PC.

4 289,99 €

Modèles : Llama 3.3 70B, Qwen 72B, Fine-tuning sur données sensibles + extension GPU à venir

Entreprises qui démarrent avec le 70B local mais veulent rester évolutives.

EXPERT 70B

Le niveau « cabinet » : modèles 70B sur données sensibles.

4 825,764 €

Modèles : Llama 3.3 70B, Qwen 72B, RAG sur documents longs

Cabinets (juridique, comptable, médical) sur données confidentielles.

DGX 120B

Le supercalculateur NVIDIA, posé sur votre bureau.

7 929,94 €

Modèles : GPT-OSS-120B ≈ 25-35 tok/s (MoE — son terrain de jeu), Llama 3.3 70B ≈ 3-4 tok/s (dense — lisible, pour l'analyse), Fine-tuning de modèles jusqu'à 200B en mémoire unifiée

Startups IA et éditeurs de SaaS qui font tourner leur propre modèle d'inférence.

8 000 à 20 000 €

Le pro affirmé : 70B local

Au-delà de 8 000 €, vous entrez dans le domaine des modèles denses de 70 milliards de paramètres— le niveau professionnel : raisonnement nuancé, documents juridiques ou médicaux, analyse fine, RAG sans limite. C'est la tranche des cabinets, directions et petites sociétés IA.

STUDIO 49B

Le raisonnement lourd, à la vitesse d'une RTX 5090.

9 112,23 €

Modèles : Nemotron Super 49B, Qwen3 32B, DeepSeek R1 32B (raisonnement)

Équipes qui font du raisonnement complexe : analyse, agents, code.

MAC 70B

Le 70B silencieux, façon Apple.

10 624 €

Modèles : Llama 3.3 70B ≈ 10-15 tok/s, Qwen3 32B ≈ 22-33 tok/s, Gamme complète 8-70B

Équipes déjà sur Mac qui veulent un 70B local sans changer d'univers.

CLUSTER 405B

Deux DGX Spark reliés : jusqu'à 405 milliards de paramètres.

15 859,87 €

Modèles : GPT-OSS-120B ≈ 25-38 tok/s, Qwen3 235B (MoE) ≈ 8-14 tok/s, Llama 405B ≈ 1-2 tok/s (batch)

Entreprises qui visent les modèles géants (120B-405B) en local.

Plus de 20 000 €

L'entreprise : 120B+ et clustering

À ce budget, vous sortez du cadre personnel : 120B et plus, plusieurs utilisateurs servis en parallèle, clustering. C'est la tranche des cabinets importants, PME avec équipe IA, startups à vocation IA — GPT-OSS-120B, Qwen 235B+, jusqu'à LLaMA 405B en cluster.

STATION IA 120B

La station IA professionnelle : jusqu'à 120B en local, GPT-OSS-120B à 150 tok/s.

28 835,46 €

Modèles : GPT-OSS-120B (MoE) ≈ 150 tok/s, Llama 3.3 70B ≈ 25 tok/s (×10 sessions), Qwen3-32B ≈ 55 tok/s

PME et cabinets qui veulent des modèles jusqu'à 120B en local, sur données confidentielles.

Au-delà

Configurations sur devis : jusqu'au datacenter

Pour les projets les plus exigeants, certaines configurations sont sur devis : supercalculateurs IA de bureau, serveurs rack multi-GPU, clustering. Fine-tuning et très grands modèles, accompagnement et infogérance inclus.

  • DGX STATION GB300Le supercalculateur IA de bureau : DeepSeek V3 671B en local, chez vous.
  • STATION IA 235BBi-GPU 192 Go : les modèles frontier open comme Qwen3-235B, à 62 tok/s.
  • SERVEUR IA 397BServeur IA quadri-GPU 384 Go : Qwen3.5-397B en local, à 80 tok/s. Sur devis.
  • SERVEUR DGX B200La puissance datacenter, chez vous : tous les modèles, à vitesse maximale.

Demander un devis adapté à votre projet →

Pièges budgétaires

Les erreurs de budget classiques

Erreur 1 : acheter trop petit pour le modèle visé

Vous voulez du LLaMA 70B mais vous n'achetez que 16 Go de VRAM ? La machine va swapper (accès disque), et vos inférences seront des dizaines de fois plus lentes. C'est un faux gain : une machine plus chère qui tourne 10 fois plus vite revient moins cher à l'usage. Ne pas sous-estimer la mémoire.

Erreur 2 : ignorer la bande passante mémoire

La vitesse d'inférence dépend presque entièrement de la bande passante mémoire, pas de la puissance brute. Une puce Apple Silicon Ultra (819 Go/s) tire un 70B plus vite que bien des GPU gaming. Une RTX PRO 6000 (960 Go/s, 96 Go de VRAM) dépasse la plupart des cartes. Vérifier cette spec avant d'acheter.

Erreur 3 : GPU gaming pour de l'inférence IA

Une carte gaming haut de gamme affiche une bande passante impressionnante, mais plafonne à 32 Go de VRAM et consomme 600 W. Une carte pro coûte plus cher à l'achat, mais offre 96 Go de VRAM, une garantie professionnelle et l'inférence multi-utilisateur — et elle porte un 120B là où la carte gaming cale. Pour l'IA, investir en VRAM, pas en cœurs bruts.

Les trois questions qui reviennent

Mini-FAQ

Quel budget pour débuter avec l'IA locale ?

Pour tester, découvrir et avoir un vrai assistant local : la première tranche du catalogue, sous les 3 000 €. Pour un usage professionnel quotidien avec RAG et documents, visez la tranche 3 000 à 8 000 €. Pour du vrai travail d'équipe sur des modèles 70B, c'est 8 000 € et plus.

Est-ce que le prix est linéaire avec la puissance ?

Non. Entre la première et la deuxième tranche, vous gagnez énormément en capacité (8B → 32B, voire 70B). Au-delà, vous gagnez surtout en bande passante et multi-utilisateur. Tout en haut, c'est la salle serveur (rack, clustering). Le saut le plus rentable est généralement entre le starter et le niveau pro.

Puis-je upgrader ma machine plus tard ?

Oui, pour certaines. Les tours acceptent des extensions GPU ; certains mini-PC ont un port OCuLink pour ajouter une carte externe plus tard ; les Mac sont figés (mémoire soudée) ; les serveurs sont extensibles par design. Précisez votre trajectoire lors du devis, on dimensionne l'évolutivité avec.

Prêt à choisir ?

Chaque configuration repose sur un benchmark signé au déballage. Utilisez le configurateur pour filtrer par budget, modèle visé et système d'exploitation — vous verrez exactement ce que vous payez.