Fecha: septiembre 2026 · Investigación: Manolín para el Gran Jefe
La IA generativa en local (modelos que se ejecutan en tu propio hardware, sin enviar datos a terceros) ha pasado de ser un hobby de entusiastas a una alternativa productiva real para empresas y personas. En 2026:
Conclusión clave: la IA local ya no es "menos capaz que la nube"; es distinta: más privada, más barata a volumen, sin límites de uso, y funciona offline. Los flujos que mejor la aprovechan son los que transforman datos propios y sensibles (documentos, audio, correo, conocimiento interno).
| Motivación | Qué resuelve |
|---|---|
| Privacidad / cumplimiento | Datos que no pueden salir de la empresa (contratos, historiales médicos, secretos industriales). GDPR/HIPAA se cumplen con controles internos, no con contratos de nube |
| Coste a volumen | Sin API por token ni suscripciones: el hardware se amortiza y el uso ilimitado sale gratis |
| Offline / latencia | Funciona sin internet, con tiempos de respuesta estables en intranet |
| Control total | Modelos, versiones, datos, logs y eliminación bajo tu mando |
| Continuidad | Los modelos locales no "cambian" o se retiran de golpe; tus flujos no se rompen por cambios de proveedor |
La forma más útil de ordenar el ecosistema es por capas:
ollama run llama3, gestión de modelos en un comando, API OpenAI-compatible en :11434. Ideal para pruebas y piloto de empresa.Problema: el equipo de soporte pierde horas buscando en manuales y FAQs; el chatbot de la web alucina si no tiene contexto. Flujo: indexar (manuales, actas, políticas, historial resuelto) → RAG → el agente responde citando la fuente → si no hay confianza, deriva al humano. Caso real: Banco Santander redujo ~40% las consultas que llegan a agentes humanos con su chatbot. En local, la ventaja es que el historial de clientes nunca sale de la red.
Problema: extraer datos de cientos de PDFs (facturas, contratos, nóminas) a mano. Flujo: carpeta de entrada → el LLM extrae campos estructurados (JSON) → validación → base de datos → informes automáticos. Por qué local: estos documentos contienen datos personales y secretos; enviarlos a una API de terceros es un riesgo de cumplimiento.
Problema: el departamento de sistemas repite respuestas (VPN, impresora, licencias). Flujo: documentación interna + RAG → chatbot de intranet (Open WebUI o bot de Teams) → resuelve el 60-80% primera línea → escala lo complejo.
Problema: abogados leen contratos largos para detectar cláusulas anómalas. Flujo: carga de contrato → resumen + detección de cláusulas de riesgo (indemnización, no competencia, renovación automática) → checklist comparado con plantilla estándar. Local = obligatorio en muchos casos por secreto profesional y GDPR.
Problema: los profesionales dedican horas a escribir notas tras cada consulta. Flujo: audio de consulta (con consentimiento) → Whisper transcribe → LLM genera nota estructurada (síntomas, diagnóstico, plan) → revisión del facultativo. Caso tipo: clínicas usan IA self-hosted para comunicación con pacientes, citas y documentación interna sin exponer PHI (HIPAA).
Problema: conciliar datos entre sistemas y redactar informes de gestión consume días al mes. Flujo: extracción de datos → LLM cruza y resalta discrepancias → borrador de informe / comentario de variaciones → humano valida.
Problema: producir variaciones de texto, traducciones y publicaciones para muchos canales. Flujo: documento Word → LLM local → presentación, resumen o adaptación por canal. Horas ahorradas por pieza.
Problema: albaranes, inspecciones y partes en papel. Flujo: foto/escaneo → visión (LLaVA) o STT → datos estructurados → ERP.
[Usuarios] → Open WebUI / Bot interno
│
▼
[LiteLLM] ── un solo endpoint ──► [Ollama / vLLM] (modelos locales)
│
└────────► [Qdrant] (RAG sobre documentos internos)
└────────► [n8n] (flujos: correo, ERP, informes)
Todo dentro de la red corporativa. Cero datos fuera.
Problema: llegan las reuniones, se pierden las decisiones y las tareas. Flujo: grabar (o Meetily/whisper directo) → transcripción local → resumen + tareas pendientes → correo automático. Herramientas: Meetily (100% local, GDPR/HIPAA por diseño, gratis Community) o Whisper + plantilla de prompt. Consejo de los prácticos: "transcribir local, resumir con el local que tengas" — y si algún día necesitas la nube, la transcripción local ya asegura que el audio crudo no se expone.
Problema: tus notas, PDFs, correos y enlaces están dispersos y no puedes "preguntarles". Flujo: carpeta de documentos → índice local (AnythingLLM/PrivateGPT) → chat: "¿qué decía el contrato del piso?", "resume mis apuntes de marzo". Casos de uso personal típicos (de asistentes self-hosted): gestión de tareas y agenda, ayuda con código y revisión, escritura y edición larga, resumen de investigaciones, aprendizaje de idiomas y traducción, gestión de correo (draft + triaje), conocimiento personal, salud y fitness, lluvia de ideas creativa.
Problema: "quiero automatizar mi vida digital sin pagar suscripciones ni ceder datos". Stack de referencia 2026: Ollama + LiteLLM (un solo endpoint, router que decide modelo grande/pequeño) + Open WebUI (chat) + n8n (automatizaciones) + Qdrant (memoria/vectores) + backups programados (pg_dump/Langfuse/Grafana). Ejemplos de flujos n8n sin nube: - Nuevo correo → clasificar (urgente/leer/archivar) → borrador de respuesta. - Webhook de formulario → registrar + LLM rellena ficha → notificación. - Podcast/audio nuevo → transcribir → resumir → guardar en notas. - Feed RSS → resumen semanal en un chat.
Flujo estrella (el mismo que querías montar en el lab):
Audio/podcast ─► Whisper (transcripción) ─► LLM local (resumen / traducción) ─► Piper TTS (audio final)
Cada paso es un servicio local invocable por API; se encadena con un orquestador (n8n o un script). Es exactamente el patrón tarea de varias fases con datos de entrada/salida encadenados que diseñamos para tu lab.
buscar-libros-biblioteca-secreta) se puede encadenar: libro → resumen local → audio local para escucharlo.next_action de tu lab: cada paso consume la salida del anterior.| Presupuesto | Hardware | Modelos recomendados | Uso |
|---|---|---|---|
| Mínimo | CPU 8-16 GB RAM (o Raspberry Pi 5 / Orange Pi) | Qwen2.5 1.5B-7B, Llama 3.2 3B, Phi-3.5 mini, Whisper small | Transcripción, resúmenes cortos, clasificación |
| Intermedio | PC 16-32 GB RAM + GPU 8-12 GB | Llama 3.1 8B, Mistral 7B, Qwen2.5 7B-14B, DeepSeek R1 7B distil | RAG, chat de empresa, agentes |
| Alto | 64 GB+ RAM + GPU 24 GB+ | Llama 3.3 70B, Qwen2.5 32B, DeepSeek R1 32B | Producción con vLLM, área entera |
Regla práctica: el modelo cabe si sus parámetros (en miles de millones) × ~1GB ≈ tu VRAM/RAM disponible. En CPU puro, los modelos ≤8B en cuantización Q4 son fluidos.
| Concepto | Nube (ej. GPT-4o clase) | Local |
|---|---|---|
| Uso mensual moderado | 20-60 €/usuario/mes | 0 € (hardware ya pagado) |
| Datos sensibles fuera | ⚠️ Sí (riesgo GDPR) | No (nunca salen) |
| Límites / rate limits | Sí | No |
| Offline | No | Sí |
| Amortización hardware | — | 6-18 meses según uso |
Ahorro típico publicado: un stack homelab n8n+Ollama cuesta ~0 €/mes frente a Zapier+OpenAI.
docker compose listas (p. ej. local-ai-packaged) que lo montan en minutos.ollama run llama3.2:3b, probar en LM Studio o Open WebUI. Criterio: ¿el resultado es útil para UNA tarea concreta?Documento generado por Manolín 🦴 · Investigación con fuentes públicas de 2025-2026 · Desplegado en la infraestructura del Gran Jefe.