Le grand modèle local
Faire tourner LLaMA 70B en local.
LLaMA 3.3 70B, c'est le niveau « cabinet » : nuances juridiques et médicales, raisonnement profond, dossiers complexes, tout chez vous. Ce guide vous dit combien de mémoire il faut, quelle machine choisir, et le débit réel que vous pouvez espérer.
Le point clé
Combien de mémoire pour un modèle 70 milliards ?
LLaMA 70B, c'est un modèle de 70 milliards de paramètres. Chaque paramètre coûte de la mémoire — plus on veut tourner vite, plus il faut de mémoire unifiée (CPU + GPU partagent la même adresse).
Pour un 70B quantifié en Q4 (la qualité standard pour les 70B en local), comptez entre 40 et 45 Go de mémoire. Mais ce n'est que le modèle. Lors de l'inférence, il faut ajouter un buffer pour le contexte(les documents qu'on branche à l'IA), la génération de réponse, et un peu de marge — vous arrivez à 60–80 Go pour tourner confortablement, surtout si vous interrogez de gros documents.
C'est pour ça que nos configurations 70B embarquent 96 Go ou 128 Go de mémoire unifiée. C'est plus qu'il faut : c'est de la marge de sécurité, et surtout, ça permet de charger plusieurs modèles, ou d'exécuter des agents complexes sans ralentissements.
Le mot de la bande
Bande passante mémoire : le facteur clé du débit.
Sachez une chose : la vitesse d'inférence, ce n'est pas la puissance, c'est la bande passante mémoire. Plus la donnée circule vite entre la mémoire et le processeur, plus vite le modèle répond. C'est le goulot — pas le calcul lui-même.
C'est pourquoi une Apple Silicon (819 Go/s) tire une 70B dense plus vite qu'une GPU sépaée moins large. Et c'est pourquoi nous recommandons la machine qui correspond à votre modèle: pas surdimensionner, mais pas se tromper d'architecture.
Les configurations qui tournent du 70B
Quatre chemins vers LLaMA 70B, du moins cher à l'entreprise.
EXPERT 70B
Le choix « seul »
Mini-PC 128 Go de mémoire unifiée, Ryzen AI Max+ 395. Pour les cabinets, les directeurs, les équipes réduites qui veulent du 70B nuancé, rien qui ne sorte de leurs murs. Inférence rapide, silencieuse, RAG documentaire inclus.
Pas de débit annoncé dans le PV (votre cas), mais validé au banc.
EVO-X3 (EXPERT + extensibilité)
Le choix « peut-être plus »
Même 128 Go unifiée, même Ryzen, mais avec OCuLink eGPU — vous pouvez brancher une RTX 5090 demain si vous voulez monter au 120B+. Pour ceux qui commencent en 70B mais ne veulent fermer aucune porte.
Parfait si vos besoins grandiront.
Mac Studio M3 Ultra 96 Go
Le choix « écosystème Apple »
Si votre équipe vit déjà sur Mac. 96 Go de mémoire unifiée, 819 Go/s de bande passante — la plus élevée du marché. LLaMA 70B y tourne à 10–15 tokens/sec (rapide pour du dense). Silence absolu, macOS, même machine pour la bureautique.
Commande constructeur, 13–14 semaines de délai.
DGX Spark 128 Go
Le choix « nuage local »
Le supercalculateur NVIDIA : 128 Go mémoire unifiée, 1 PFLOP, écosystème CUDA complet. LLaMA 70B y tourne à 3–4 tokens/sec (plus lent que le Mac, car moins de bande passante). Mais c'est le 70B partagé par plusieurs utilisateurs, c'est le fine-tuning jusqu'à 200B, c'est le clustering vers du 405B demain.
Plus cher, mais écosystème d'équipe.
Note sur les débits: le Mac Studio atteint 10–15 tok/s sur LLaMA 70B car sa bande passante mémoire (819 Go/s) surpasse le DGX Spark (273 Go/s) — c'est l'avantage de l'architecture unifiée Apple. Le DGX brille ailleurs : 128 Go au lieu de 96, CUDA, fine-tuning jusqu'à 200B, clustering.
L'usage courant
Concrètement : à quoi ça ressemble en production ?
Vous lancez Open WebUI (l'interface Web fournie sur toutes les machines). Vous collage un document de 50 pages, vous tapez « Résume-moi ce document et liste les points clés ». LLaMA 70B lit le document en local, génère la réponse, tout chez vous.
Une autre équipe, en même temps sur le même Mac ou le même DGX, peut interroger un dossier clienttandis que vous passez en revue de contrats juridiques. Chacun a son contexte séparé, pas de limite de tokens, pas de facture.
C'est le RAG — le « Retrieval Augmented Generation » — en action. Vos dossiers, votre IA, vos données, jamais ailleurs.
Les trois questions qui reviennent
Mini-FAQ
Quel est le débit le plus rapide pour du LLaMA 70B local ?
Le Mac Studio M3 Ultra atteint 10–15 tokens/sec— c'est le plus rapide du catalogue, grâce à sa bande passante de 819 Go/s. Pour une inférence très dense (documents longs, pas de contexte additionnel), c'est le meilleur choix si vous êtes sur Mac. Le DGX Spark, plus puissant en calcul brut, est limité à 3–4 tok/s sur dense 70B — mais c'est pas son terrain de jeu (il préfère les MoE comme GPT-OSS-120B).
Est-ce que 96 Go suffisent pour du LLaMA 70B à plusieurs utilisateurs ?
Oui. 40–45 Go pour le modèle, 10–15 Go par session d'inférence = vous pouvez servir 3–4 utilisateurs en parallèle sur le Mac Studio 96 Go sans problème. Si vous en avez 10, passez au DGX (128 Go) ou au cluster.
Je suis en Windows. Quel 70B me recommandez-vous ?
EXPERT 70B ou DGX Spark — tous deux supportent Windows 11 Pro. L'EXPERT est plus compact et moins cher ; le DGX vous offre l'écosystème CUDA complet et la scalabilité. Vous n'avez pas de bon choix 70B avec Apple Silicon si vous êtes en Windows — le Mac Studio, c'est Mac OS uniquement.
Prêt à déployer du 70B local ?
Chaque configuration ci-dessus repose sur un benchmark signé au déballage. Consultez la fiche complète de chaque machine, ou trouvez celle qui vous convient en 5 minutes.