Aller au contenu
Tous les articles9 min de lecture

Faire tourner un LLM en local dans son entreprise

Exécuter un LLM en local n'est plus un exercice de laboratoire. La question n'est plus de savoir si c'est possible, mais quel matériel il faut, quel modèle choisir, et comment relier tout cela à des usages métier réels. Voici les éléments de décision, sans jargon inutile.

Ce qui détermine tout : la mémoire

La contrainte dominante d'un LLM local n'est pas la puissance de calcul, c'est la mémoire. Pour répondre, un modèle doit tenir entièrement en mémoire accessible par le processeur graphique. S'il n'y tient pas, il ne s'exécute pas, ou s'exécute à une lenteur inutilisable.

L'ordre de grandeur est simple. Un modèle annoncé à 70 milliards de paramètres occupe environ 140 Go en précision 16 bits, environ 70 Go en 8 bits, et environ 40 Go en 4 bits. À cela s'ajoute le cache d'attention, qui grandit avec la longueur du contexte : analyser un contrat de cent pages consomme nettement plus qu'une question courte.

C'est pourquoi la mémoire unifiée change la donne. Les 128 Go de mémoire unifiée de la superpuce NVIDIA GB10 Grace Blackwell sont partagés entre le processeur et la partie graphique, sans transfert coûteux entre deux espaces séparés. Un modèle qui exigeait hier plusieurs cartes professionnelles tient dans un boîtier de bureau.

La quantification, en clair

Quantifier un modèle consiste à réduire la précision numérique de ses poids : passer de 16 bits à 8, voire 4 bits. Le modèle occupe moins de mémoire et répond plus vite, au prix d'une perte de qualité.

En pratique, sur les usages professionnels courants, le passage en 8 bits est quasiment indolore. Le passage en 4 bits reste très exploitable pour la rédaction, la synthèse ou l'extraction d'information. Il devient plus discutable sur du raisonnement long ou du code complexe. La bonne démarche consiste à tester sur vos propres documents plutôt qu'à se fier à un classement générique.

Quel modèle choisir

Le réflexe naturel est de viser le plus gros modèle possible. C'est rarement le bon calcul. Un modèle de taille moyenne, rapide et bien relié à vos données, produit de meilleurs résultats métier qu'un très grand modèle lent qui ignore votre contexte.

Trois critères comptent davantage que le nombre de paramètres.

  • La licence : vérifiez qu'elle autorise l'usage commercial et l'exécution sur votre propre matériel, sans clause de remontée de données.
  • La qualité en français : beaucoup de modèles sont évalués en anglais, et les écarts en français sont parfois importants.
  • La longueur de contexte réellement utile : un contexte annoncé très large n'est pas toujours exploité correctement sur toute sa longueur.

Un modèle seul ne sert à rien

C'est l'erreur la plus fréquente des premiers projets internes. On installe un modèle, on obtient une fenêtre de discussion, et l'enthousiasme retombe en trois semaines. Un LLM sans accès à vos documents ne fait que produire du texte générique.

Ce qui crée la valeur, c'est la couche autour : l'indexation de vos documents pour que le modèle réponde en s'appuyant dessus, la gestion des droits pour qu'un utilisateur ne voie que ce qu'il a le droit de voir, l'historique, les espaces de travail par équipe, et l'intégration aux outils existants.

C'est précisément ce que Devana OS apporte sur DIWY. La box n'expose pas un modèle brut : elle fait tourner Suite 366, la suite de travail, et Devana, la plateforme IA d'entreprise, déjà reliées au modèle et entièrement hors ligne.

Combien d'utilisateurs sur une seule machine

La question revient systématiquement. Une inférence occupe la machine pendant qu'elle produit sa réponse, mais les usages réels sont intermittents : un collaborateur pose une question, lit la réponse, travaille, revient dix minutes plus tard.

Sur DIWY, la configuration retenue tient une vingtaine d'utilisateurs simultanés sur les usages courants. Pour une PME, un cabinet ou une direction métier, cela couvre l'essentiel du besoin sans salle serveur ni climatisation dédiée.

Le coût réel, comparé

Le calcul honnête ne se limite pas au prix du matériel. Il faut compter l'intégration, la maintenance, les mises à jour de modèles et le temps interne consacré à tout cela. C'est ce poste, et non le matériel, qui fait dérailler la plupart des projets construits maison.

Un modèle en location déplace ce risque. DIWY est proposée à 500 € par mois avec un engagement de douze mois, ou 750 € par mois sans engagement, avec une caution remboursable de 750 € à la commande. Le matériel, le système et les deux applications sont inclus, et la box est livrée en 72h.

À retenir

  • La mémoire disponible, pas la puissance brute, détermine quels modèles vous pouvez exécuter.
  • La quantification en 8 bits est quasiment indolore sur les usages professionnels courants.
  • Un modèle sans indexation de vos documents ni gestion des droits ne produit pas de valeur métier.
  • Le coût caché d'un LLM local est l'intégration et la maintenance, pas l'achat du matériel.

Questions fréquentes

Quelle mémoire faut-il pour un LLM utilisable en entreprise ?

Comptez au minimum 48 Go pour travailler confortablement avec un modèle de taille moyenne et des contextes longs. Les 128 Go de mémoire unifiée de DIWY laissent de la marge pour des modèles plus grands et plusieurs utilisateurs simultanés.

Un LLM local fonctionne-t-il sans connexion internet ?

Oui, c'est tout l'intérêt. Une fois les modèles installés, l'inférence ne nécessite aucun accès réseau sortant. Sur DIWY, Suite 366 et Devana fonctionnent entièrement hors ligne.

Peut-on entraîner son propre modèle en local ?

Un entraînement complet depuis zéro reste hors de portée d'une machine de bureau. En revanche, l'ajustement fin d'un modèle existant et surtout l'indexation de vos documents, qui couvre la majorité des besoins métier, sont parfaitement réalisables localement.

Faut-il un serveur en rack et une salle climatisée ?

Non. DIWY est un boîtier de bureau qui se branche sur une prise standard et sur votre réseau. Aucune infrastructure spécifique n'est nécessaire.

Votre IA, dans vos murs.

DIWY est disponible dès maintenant, livrée en 72h, préconfigurée avec vos applications.

Commander une DIWY
LLM local en entreprise : le guide pratique · DIWY