IA Privada · local y aislada de la red
IA que nunca sale de tu red.
Modelos de pesos abiertos y agentes corriendo en tu propio hardware, detrás de tu firewall, para trabajo donde la salida de datos no es opción. Proxmox, Docker, PyTorch, Ollama, vLLM — código abierto de extremo a extremo.

01 · capas
Las capas, de extremo a extremo.
Un stack coherente — del hipervisor a los agentes — elegido para que cada capa sea reemplazable, cada modelo auditable, y nada dependa de una API de terceros.
stack · rutas de gpu
Dos rutas de GPU, un mismo manual.
La elección de hardware es una decisión de presupuesto y cadena de suministro, no un lock-in. El mismo stack corre en ambos fabricantes — las diferencias reales viven en tres lugares: configuración del passthrough, flags del runtime y madurez del serving.
02 · postura de seguridad
Seis cosas que no son opcionales.
Una plataforma de IA privada es tan buena como los controles aburridos detrás de ella. Estos son los valores por defecto en cada despliegue.
01 · Cero salida de red
La inferencia y los datos se quedan dentro de la LAN. Los modelos de pesos abiertos se descargan una sola vez durante el aprovisionamiento y luego se cierra la conexión hacia arriba. La VLAN de inferencia no tiene ruta por defecto hacia internet.
02 · Aislamiento de red
Las cargas de IA viven en su propia VLAN y zona de firewall, separadas de los endpoints de usuario. Reglas entre zonas en MikroTik; plano de administración en una red de gestión dedicada con sus propias ACLs.
03 · Procedencia e integridad
Cada versión de modelo queda pineada (tag + SHA), se verifica su checksum antes de cargarla y se limita al formato safetensors. Nada de pickle, nada de rutas de ejecución de código remoto, nada de sorpresas al desplegar.
04 · Agentes con mínimo privilegio
Los agentes arrancan en modo solo lectura. Las herramientas que escriben — a disco, a una base de datos, a un sistema externo — requieren aprobación humana explícita por llamada. El valor por defecto es 'preguntar', no 'actuar'.
05 · Higiene de secretos
Sin claves de API, tokens ni credenciales en prompts, logs o historial de git. Un almacén de secretos local (HashiCorp Vault o equivalente) con credenciales de corta duración y rotación documentada.
06 · Auditabilidad
Logs append-only de cada request, cada llamada a herramienta y cada acción — suficiente para responder 'qué hizo el agente y por qué' meses después. La retención es configurable; la integridad está firmada.
03 · arquitectura de referencia
Cómo se conectan las piezas.
La misma forma cada vez: los usuarios llegan al gateway de agentes a través de un reverse proxy, el gateway habla con Ollama o vLLM en la VM con GPU, y nada cruza el límite de la VLAN.
┌─────────────────────────────────────────────────────────────────┐
│ users (browser / api clients) │
└─────────────────────────────────────────────────────────────────┘
│ tls
▼
┌─────────────────────────────────────────────────────────────────┐
│ reverse proxy · nginx / caddy │
└─────────────────────────────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────────────────────┐
│ agent gateway · langgraph / custom loop │
│ · read-only tools by default │
│ · human-in-the-loop gate on every write action │
│ · append-only audit log │
└─────────────────────────────────────────────────────────────────┘
│ │ │
▼ ▼ ▼
┌──────────────────┐ ┌─────────────────────────┐ ┌──────────────┐
│ postgres + vector │ │ ollama / vllm │ │ object store │
│ (rag, audit) │ │ gpu vm · open weights │ │ (docs, logs) │
└──────────────────┘ └─────────────────────────┘ └──────────────┘
│ │ │
└──────────── vlan · ai-internal ──────────────┘
│ no egress
▼
(firewall)04 · modalidades
Cuatro formas que suele tomar el trabajo.
Cada engagement se dimensiona y presupuesta después del diagnóstico. Elige la que coincide con el problema, o combínalas.
05 · cuándo tiene sentido
Si alguna de estas te suena, deberíamos hablar.
La IA privada es la respuesta correcta cuando la opción pública es la respuesta equivocada. Algunas señales honestas.
Datos regulados — salud, legal, finanzas — que no pueden salir de entornos controlados.
Secretos comerciales o propiedad intelectual dentro de los prompts: código, modelos, contratos, datos de clientes, estrategia interna.
Sitios offline o de baja conectividad — buques de investigación, plantas, instalaciones seguras — donde el enlace es intermitente o no existe.
Costo predecible bajo carga sostenida — gasto plano en hardware en lugar de facturación por token que escala con la adopción.
/contacto
¿Tienes datos que no pueden salir del edificio?
Cuéntame qué estás corriendo, qué toca y qué no puede hacer. Leo cada nota y respondo en dos días hábiles.





