Ir al contenido
Todos los artículos8 min de lectura

Qué hardware para un servidor de IA local

Montar un servidor de IA internamente parece un ejercicio informático clásico. No lo es. Los criterios que hacen buena una máquina de inferencia no son los de un servidor de aplicaciones, y los errores de dimensionamiento se pagan de inmediato.

Primero la memoria, después la potencia

En un servidor clásico se mira el procesador. En una máquina de inferencia se mira primero la memoria accesible por el procesador gráfico, porque determina qué modelos pueden ejecutarse. La potencia de cálculo determina después la velocidad de respuesta.

El orden importa. Una máquina muy potente con poca memoria no puede ejecutar un modelo grande, por potente que sea. Una máquina más modesta con mucha memoria sí lo ejecuta, más despacio, pero lo ejecuta.

Memoria dedicada o memoria unificada

La arquitectura clásica separa la memoria del procesador de la de la tarjeta gráfica. Cada intercambio entre ambas pasa por un bus, lo que cuesta tiempo. Para superar cierto tamaño de modelo hay que sumar entonces varias tarjetas, con el coste, el consumo y la complejidad que ello conlleva.

La arquitectura unificada elimina esa separación: procesador y parte gráfica direccionan el mismo espacio de memoria. El superchip NVIDIA GB10 Grace Blackwell sigue este principio con 128 GB unificados, lo que permite cargar en una caja de escritorio modelos que antes exigían una configuración multitarjeta.

Las partidas que siempre se olvidan

El presupuesto de un servidor de IA casero supera casi siempre la estimación inicial, porque varias partidas no se anticipan.

  • La alimentación eléctrica: una configuración multi-GPU supera con frecuencia lo que puede dar un enchufe de oficina estándar.
  • La refrigeración y el ruido: estas máquinas están pensadas para salas técnicas, no para una planta diáfana.
  • El almacenamiento rápido: los modelos pesan decenas de gigabytes y se cargan a menudo. Un almacenamiento lento penaliza cada arranque.
  • La capa de software: controladores, motor de inferencia, actualizaciones de modelos. Es la partida que más tiempo interno consume a lo largo del tiempo.

Dimensionar según el número de usuarios

Una inferencia ocupa la máquina el tiempo que tarda en producir su respuesta. Pero el uso es intermitente: se pregunta, se lee, se trabaja, se vuelve. El dimensionamiento se hace por tanto sobre la simultaneidad real, no sobre el número de cuentas.

Para un equipo de veinte a treinta personas, una sola máquina bien dimensionada suele bastar. DIWY está calibrada para una veintena de usuarios simultáneos en los usos habituales, con 1 PFLOP en precisión FP4, 128 GB de memoria unificada y 4 TB de NVMe.

Comprar, montar o alquilar

Montarlo uno mismo ofrece el mejor control y la peor relación entre tiempo invertido y resultado, salvo que ya se disponga de competencias MLOps internas. El hardware es solo la parte visible: es la capa de software la que exige atención continua.

Comprar una máquina lista para usar elimina el montaje pero deja a tu cargo la explotación y la obsolescencia, en un campo donde el hardware evoluciona rápido.

El alquiler desplaza ese riesgo al proveedor. DIWY se ofrece a 500 € al mes con un compromiso de doce meses, o 750 € al mes sin compromiso, con una fianza reembolsable de 750 € al hacer el pedido. El hardware, Devana OS, Suite 366 y Devana están incluidos, y la box se entrega en 72 h.

Para recordar

  • La memoria accesible determina qué modelos se ejecutan. La potencia solo regula la velocidad.
  • La memoria unificada evita apilar tarjetas gráficas para alcanzar el tamaño de modelo deseado.
  • Electricidad, ruido, almacenamiento rápido y mantenimiento de software son las partidas sistemáticamente subestimadas.
  • El dimensionamiento se calcula sobre la simultaneidad real, no sobre el número de usuarios declarados.

Preguntas frecuentes

¿Basta con una tarjeta gráfica de videojuegos?

Para descubrir, sí. Para un uso colectivo, la memoria disponible se vuelve limitante enseguida, y nada está previsto para el funcionamiento continuo ni para varios usuarios simultáneos.

¿Hace falta una sala de servidores?

No con una máquina de escritorio. DIWY se conecta a un enchufe estándar y a tu red, sin climatización ni armario dedicado.

¿Cuánto almacenamiento hay que prever?

Cuenta con holgura. Entre varios modelos, sus variantes cuantizadas y el índice de tus documentos, el espacio se va rápido. DIWY incorpora 4 TB de NVMe.

¿Quedará obsoleto el hardware en dos años?

El campo evoluciona rápido, es un hecho. Es el argumento principal a favor del alquiler frente a la compra: el riesgo de obsolescencia se queda en el proveedor.

Tu IA, dentro de tus paredes.

DIWY está disponible ya, con entrega en 72 h y preconfigurada con tus aplicaciones.

Pedir una DIWY
Servidor de IA local: qué hardware elegir · DIWY