Quel matériel pour un serveur IA local
Monter un serveur d'IA en interne ressemble à un exercice d'informatique classique. Il n'en est pas un. Les critères qui font une bonne machine d'inférence ne sont pas ceux d'un serveur applicatif, et les erreurs de dimensionnement se paient immédiatement.

La mémoire d'abord, la puissance ensuite
Sur un serveur classique, on regarde le processeur. Sur une machine d'inférence, on regarde d'abord la mémoire accessible par le processeur graphique, parce qu'elle détermine quels modèles peuvent tourner. La puissance de calcul détermine ensuite la vitesse de réponse.
L'ordre compte. Une machine très puissante avec peu de mémoire ne peut pas exécuter un grand modèle, quelle que soit sa puissance. Une machine plus modeste avec beaucoup de mémoire l'exécute, plus lentement, mais elle l'exécute.
Mémoire dédiée ou mémoire unifiée
L'architecture classique sépare la mémoire du processeur de celle de la carte graphique. Chaque échange entre les deux passe par un bus, ce qui coûte du temps. Pour dépasser une certaine taille de modèle, il faut alors additionner plusieurs cartes, avec le coût, la consommation et la complexité qui vont avec.
L'architecture unifiée supprime cette séparation : processeur et partie graphique adressent le même espace mémoire. La superpuce NVIDIA GB10 Grace Blackwell suit ce principe avec 128 Go unifiés, ce qui permet de charger dans un boîtier de bureau des modèles qui demandaient auparavant une configuration multi-cartes.
Les postes que l'on oublie systématiquement
Le budget d'un serveur IA maison dépasse presque toujours l'estimation initiale, parce que plusieurs postes ne sont pas anticipés.
- L'alimentation électrique : une configuration multi-GPU dépasse fréquemment ce qu'une prise de bureau standard peut fournir.
- Le refroidissement et le bruit : ces machines sont conçues pour des salles techniques, pas pour un plateau ouvert.
- Le stockage rapide : les modèles pèsent des dizaines de gigaoctets et se chargent souvent. Un stockage lent pénalise chaque démarrage.
- La couche logicielle : pilotes, moteur d'inférence, mises à jour de modèles. C'est le poste qui consomme le plus de temps interne sur la durée.
Dimensionner selon le nombre d'utilisateurs
Une inférence occupe la machine le temps de produire sa réponse. Mais les usages sont intermittents : on pose une question, on lit, on travaille, on revient. Le dimensionnement se fait donc sur la simultanéité réelle, pas sur le nombre de comptes.
Pour une équipe de vingt à trente personnes, une seule machine bien dimensionnée suffit généralement. DIWY est calibrée pour une vingtaine d'utilisateurs simultanés sur les usages courants, avec 1 PFLOP en précision FP4, 128 Go de mémoire unifiée et 4 To de NVMe.
Acheter, assembler ou louer
Assembler soi-même offre le meilleur contrôle et le pire rapport entre temps investi et résultat, sauf si vous disposez déjà de compétences MLOps en interne. Le matériel n'est que la partie visible : c'est la couche logicielle qui demande de l'attention en continu.
Acheter une machine prête à l'emploi supprime l'assemblage mais laisse à votre charge l'exploitation et l'obsolescence, dans un domaine où le matériel évolue vite.
La location déplace ce risque sur le fournisseur. DIWY est proposée à 500 € par mois avec un engagement de douze mois, ou 750 € par mois sans engagement, avec une caution remboursable de 750 € à la commande. Le matériel, Devana OS, Suite 366 et Devana sont inclus, et la box est livrée en 72h.
À retenir
- La mémoire accessible détermine quels modèles tournent. La puissance ne fait que régler la vitesse.
- La mémoire unifiée évite d'empiler des cartes graphiques pour atteindre la taille de modèle voulue.
- Électricité, bruit, stockage rapide et maintenance logicielle sont les postes systématiquement sous-estimés.
- Le dimensionnement se calcule sur la simultanéité réelle, pas sur le nombre d'utilisateurs déclarés.
Questions fréquentes
Une carte graphique de jeu suffit-elle ?
Pour découvrir, oui. Pour un usage collectif, la mémoire disponible devient rapidement limitante, et rien n'est prévu pour le fonctionnement continu ni pour plusieurs utilisateurs simultanés.
Faut-il une salle serveur ?
Pas avec une machine de bureau. DIWY se branche sur une prise standard et sur votre réseau, sans climatisation ni baie dédiée.
Combien de stockage prévoir ?
Comptez large. Entre plusieurs modèles, leurs variantes quantifiées et l'index de vos documents, l'espace part vite. DIWY embarque 4 To de NVMe.
Le matériel sera-t-il obsolète dans deux ans ?
Le domaine évolue vite, c'est un fait. C'est l'argument principal en faveur de la location plutôt que de l'achat : le risque d'obsolescence reste chez le fournisseur.
Votre IA, dans vos murs.
DIWY est disponible dès maintenant, livrée en 72h, préconfigurée avec vos applications.
Commander une DIWY