IA Privada · local y aislada de la red

IA que nunca sale de tu red.

Modelos de pesos abiertos y agentes corriendo en tu propio hardware, detrás de tu firewall, para trabajo donde la salida de datos no es opción. Proxmox, Docker, PyTorch, Ollama, vLLM — código abierto de extremo a extremo.

Servidor GPU brillando en ámbar dentro de un rack oscuro — la caja de inferencia privada

01 · capas

Las capas, de extremo a extremo.

Un stack coherente — del hipervisor a los agentes — elegido para que cada capa sea reemplazable, cada modelo auditable, y nada dependa de una API de terceros.

Hipervisor · Proxmox VE 9 — ilustración técnica
Hipervisor · Proxmox VE 9
Máquinas virtuales KVM y contenedores LXC en una sola plataforma, con passthrough de GPU hacia la VM de inferencia — NVIDIA (passthrough completo o vGPU) y AMD (passthrough PCIe) por igual. Clustering con HA y migración en vivo entre nodos, respaldos nocturnos con Proxmox Backup Server. Código abierto bajo AGPLv3 — sin licenciamiento por socket.
Capa de contenedores · Docker — ilustración técnica
Capa de contenedores · Docker
Imágenes reproducibles y versionadas para cada servicio — Ollama, vLLM, Postgres, el gateway de agentes. NVIDIA Container Toolkit expone la GPU a los contenedores; modo rootless, sistemas de archivos de solo lectura y no-new-privileges son la línea base. Todo se reconstruye desde los compose files en git.
Inferencia · Ollama & vLLM — ilustración técnica
Inferencia · Ollama & vLLM
Modelos de pesos abiertos servidos sobre una API local compatible con OpenAI. Ollama para simplicidad e iteración rápida; vLLM (un proyecto de la PyTorch Foundation) cuando el rendimiento, el batching y PagedAttention importan. Completamente offline una vez descargados los pesos del modelo — la inferencia nunca sale a la red.
Runtime debajo · PyTorch — ilustración técnica
Runtime debajo · PyTorch
El framework debajo de los pipelines de fine-tuning y embeddings — PyTorch estable 2.7, sobre CUDA 12.8 para NVIDIA y ROCm 6.x para AMD. Se usa cuando un modelo general de pesos abiertos no alcanza y hace falta un embedder afinado al dominio o un adaptador LoRA en el mismo equipo.
Agentes · LangGraph & loops a medida — ilustración técnica
Agentes · LangGraph & loops a medida
Bucles de razonamiento sobre la API local — LangGraph o hechos a mano — con herramientas de mínimo privilegio y una compuerta human-in-the-loop en cada acción de escritura. El agente solo ve lo que su alcance permite; cada llamada a herramienta queda registrada antes de ejecutarse.

stack · rutas de gpu

Dos rutas de GPU, un mismo manual.

La elección de hardware es una decisión de presupuesto y cadena de suministro, no un lock-in. El mismo stack corre en ambos fabricantes — las diferencias reales viven en tres lugares: configuración del passthrough, flags del runtime y madurez del serving.

Tarjeta gráfica con estelas de luz ámbar — ruta NVIDIA CUDA
NVIDIA · CUDA
La ruta de menor resistencia. CUDA 12.8 en todo el stack — PyTorch, vLLM, Ollama — con passthrough completo o vGPU en Proxmox (migración en vivo en tarjetas datacenter).
  • Tarjetas RTX / datacenter, passthrough o vGPU
  • Wheels CUDA 12.8 — sin parches, sin flags
  • Ideal para: tooling más suave, entrenamiento + inferencia mixtos
Tarjeta gráfica Radeon con luz roja y ámbar — ruta AMD ROCm
AMD · ROCm
Más VRAM por dólar. ROCm 6.x en Radeon (7900 XTX, clase 24 GB) o Instinct — passthrough PCIe completo hacia la VM de inferencia, builds ROCm de Ollama, vLLM y PyTorch. Requiere un poco más de cuidado: verificar la lista de GPUs soportadas y definir el override gfx en tarjetas no oficiales.
  • Radeon 7900 XTX / serie Instinct MI vía passthrough PCIe
  • Builds ROCm de Ollama, vLLM y PyTorch 2.7
  • Ideal para: máxima VRAM por dólar, equipos de inferencia

02 · postura de seguridad

Seis cosas que no son opcionales.

Una plataforma de IA privada es tan buena como los controles aburridos detrás de ella. Estos son los valores por defecto en cada despliegue.

  1. 01 · Cero salida de red

    La inferencia y los datos se quedan dentro de la LAN. Los modelos de pesos abiertos se descargan una sola vez durante el aprovisionamiento y luego se cierra la conexión hacia arriba. La VLAN de inferencia no tiene ruta por defecto hacia internet.

  2. 02 · Aislamiento de red

    Las cargas de IA viven en su propia VLAN y zona de firewall, separadas de los endpoints de usuario. Reglas entre zonas en MikroTik; plano de administración en una red de gestión dedicada con sus propias ACLs.

  3. 03 · Procedencia e integridad

    Cada versión de modelo queda pineada (tag + SHA), se verifica su checksum antes de cargarla y se limita al formato safetensors. Nada de pickle, nada de rutas de ejecución de código remoto, nada de sorpresas al desplegar.

  4. 04 · Agentes con mínimo privilegio

    Los agentes arrancan en modo solo lectura. Las herramientas que escriben — a disco, a una base de datos, a un sistema externo — requieren aprobación humana explícita por llamada. El valor por defecto es 'preguntar', no 'actuar'.

  5. 05 · Higiene de secretos

    Sin claves de API, tokens ni credenciales en prompts, logs o historial de git. Un almacén de secretos local (HashiCorp Vault o equivalente) con credenciales de corta duración y rotación documentada.

  6. 06 · Auditabilidad

    Logs append-only de cada request, cada llamada a herramienta y cada acción — suficiente para responder 'qué hizo el agente y por qué' meses después. La retención es configurable; la integridad está firmada.

03 · arquitectura de referencia

Cómo se conectan las piezas.

La misma forma cada vez: los usuarios llegan al gateway de agentes a través de un reverse proxy, el gateway habla con Ollama o vLLM en la VM con GPU, y nada cruza el límite de la VLAN.

  ┌─────────────────────────────────────────────────────────────────┐
  │  users (browser / api clients)                                  │
  └─────────────────────────────────────────────────────────────────┘
                              │ tls
                              ▼
  ┌─────────────────────────────────────────────────────────────────┐
  │  reverse proxy · nginx / caddy                                  │
  └─────────────────────────────────────────────────────────────────┘
                              │
                              ▼
  ┌─────────────────────────────────────────────────────────────────┐
  │  agent gateway · langgraph / custom loop                        │
  │   · read-only tools by default                                  │
  │   · human-in-the-loop gate on every write action                │
  │   · append-only audit log                                       │
  └─────────────────────────────────────────────────────────────────┘
            │                            │                │
            ▼                            ▼                ▼
  ┌──────────────────┐    ┌─────────────────────────┐   ┌──────────────┐
  │ postgres + vector │    │ ollama / vllm           │   │ object store │
  │ (rag, audit)      │    │ gpu vm · open weights   │   │ (docs, logs) │
  └──────────────────┘    └─────────────────────────┘   └──────────────┘
            │                            │                │
            └──────────── vlan · ai-internal ──────────────┘
                              │ no egress
                              ▼
                          (firewall)
vlan · ai-internal · sin salida a la redreference-arch · ascii

04 · modalidades

Cuatro formas que suele tomar el trabajo.

Cada engagement se dimensiona y presupuesta después del diagnóstico. Elige la que coincide con el problema, o combínalas.

Plataforma de LLM privado
Levantar una plataforma de LLM privado funcional en tu hardware: dimensionamiento del cluster, despliegue de Proxmox, configuración de la VM con GPU, servicio con Ollama o vLLM, monitoreo y respaldos.

Qué incluye

  • Dimensionamiento y plan de hardware (CPU, RAM, GPU, storage, red)
  • Cluster Proxmox VE 9 con HA y migración en vivo
  • Passthrough de GPU / vGPU hacia la VM de inferencia — NVIDIA CUDA o AMD ROCm
  • Ollama o vLLM con versiones pineadas y solo safetensors
  • Monitoreo (nodo, GPU, profundidad de cola) y snapshots con Proxmox Backup Server
Agentes para operaciones sensibles
Construir y desplegar agentes que tocan datos internos reales — RAG sobre tus documentos, copilotos de operaciones, automatización de flujos — con compuertas de aprobación en cada escritura.

Qué incluye

  • RAG sobre documentos internos (Postgres + pgvector, o la vector DB que elijas)
  • Function/tool calling con un registro de herramientas de mínimo privilegio
  • Aprobación human-in-the-loop en cada acción de escritura
  • Log append-only de auditoría para cada paso del agente
Endurecimiento y operaciones
Mantener una plataforma de IA privada funcionando en silencio — cadencia de parches, pipeline de actualización de modelos, simulacros de DR, planeación de capacidad y runbooks de incidentes.

Qué incluye

  • Cadencia de parches para hipervisor, contenedores e imágenes base
  • Pipeline de actualización de modelos con canary rollout y rollback
  • Simulacros de disaster recovery y validación de runbooks
  • Planeación de capacidad contra throughput sostenido de tokens
Migración de la nube a local
Mover una carga de trabajo que está filtrando prompts o datos sensibles a una API de terceros — de vuelta a tu propio metal. Inventariar lo que sale hoy, correr pruebas de paridad, cortar el tráfico por etapas.

Qué incluye

  • Inventario de llamadas actuales a APIs externas y qué llevan
  • Pruebas de paridad contra los modelos locales elegidos
  • Cutover por etapas con shadow traffic y puntos de rollback
  • Documentación y runbooks para la nueva plataforma

05 · cuándo tiene sentido

Si alguna de estas te suena, deberíamos hablar.

La IA privada es la respuesta correcta cuando la opción pública es la respuesta equivocada. Algunas señales honestas.

  • Datos regulados — salud, legal, finanzas — que no pueden salir de entornos controlados.

  • Secretos comerciales o propiedad intelectual dentro de los prompts: código, modelos, contratos, datos de clientes, estrategia interna.

  • Sitios offline o de baja conectividad — buques de investigación, plantas, instalaciones seguras — donde el enlace es intermitente o no existe.

  • Costo predecible bajo carga sostenida — gasto plano en hardware en lugar de facturación por token que escala con la adopción.

/contacto

¿Tienes datos que no pueden salir del edificio?

Cuéntame qué estás corriendo, qué toca y qué no puede hacer. Leo cada nota y respondo en dos días hábiles.

Iniciar una conversación