# 🤖 Flujos de trabajo con IA en local
### Problemas reales de empresas y personas que se resuelven sin depender de la nube

**Fecha:** septiembre 2026 · **Investigación:** Manolín para el Gran Jefe

---

## 1. Resumen ejecutivo

La IA generativa **en local** (modelos que se ejecutan en tu propio hardware, sin enviar datos a terceros) ha pasado de ser un hobby de entusiastas a una **alternativa productiva real** para empresas y personas. En 2026:

- **Ollama soporta más de 80 modelos** (Llama, Mistral, Gemma, Qwen, DeepSeek R1, Phi...) y expone una API compatible con OpenAI, lo que hace que cualquier herramienta existente funcione cambiando solo la URL.
- El 78% de las organizaciones ya usa IA en al menos una función de negocio, y una tendencia creciente la ejecuta **on-premise** para cumplir GDPR, HIPAA y políticas de privacidad.
- El "stack homelab" tipo (Ollama + Open WebUI + n8n + LiteLLM + Qdrant) **sustituye a Zapier + OpenAI con coste mensual ≈ 0 €** y con los datos dentro de tu red.

**Conclusión clave:** la IA local ya no es "menos capaz que la nube"; es *distinta*: más privada, más barata a volumen, sin límites de uso, y funciona offline. Los flujos que mejor la aprovechan son los que transforman **datos propios y sensibles** (documentos, audio, correo, conocimiento interno).

---

## 2. Por qué IA en local (motivaciones reales)

| Motivación | Qué resuelve |
|---|---|
| **Privacidad / cumplimiento** | Datos que no pueden salir de la empresa (contratos, historiales médicos, secretos industriales). GDPR/HIPAA se cumplen con controles internos, no con contratos de nube |
| **Coste a volumen** | Sin API por token ni suscripciones: el hardware se amortiza y el uso ilimitado sale gratis |
| **Offline / latencia** | Funciona sin internet, con tiempos de respuesta estables en intranet |
| **Control total** | Modelos, versiones, datos, logs y eliminación bajo tu mando |
| **Continuidad** | Los modelos locales no "cambian" o se retiran de golpe; tus flujos no se rompen por cambios de proveedor |

---

## 3. Panorama de herramientas (2026)

La forma más útil de ordenar el ecosistema es **por capas**:

### 3.1 Motores (runtimes) — dónde "corre" el modelo
- **Ollama** — el más popular: `ollama run llama3`, gestión de modelos en un comando, API OpenAI-compatible en `:11434`. Ideal para pruebas y piloto de empresa.
- **llama.cpp** — el motor base, máximo control, funciona hasta en CPU y Raspberry Pi.
- **vLLM** — alto rendimiento y producción: sirve a un área entera con colas, streaming y throughput alto. Se usa cuando el piloto de Ollama funcionó.
- **LocalAI** — un binario con API compatible con OpenAI, Anthropic, Ollama y ElevenLabs: cambias la URL y las herramientas siguen funcionando.

### 3.2 Interfaces de usuario
- **LM Studio** / **Jan** / **GPT4All** — apps de escritorio pulidas para probar modelos (LM Studio suele ir mejor en hardware modesto por Vulkan).
- **Open WebUI** — el "ChatGPT privado" en navegador: chats, historial, subida de documentos, multi-modelo. Es la puerta de entrada del equipo.
- **LibreChat** — alternativa multi-proveedor.

### 3.3 RAG y conocimiento propio (pregunta a tus documentos)
- **AnythingLLM**, **PrivateGPT**, **LocalRAG** — indexan PDFs, notas, actas y responden citando las fuentes, sin subir los originales.
- **Qdrant / Chroma / pgvector** — bases vectoriales donde vive el índice.
- Regla GDPR de referencia (PromptQuorum): para datos sensibles hay que tener **6 controles** desde el día uno: hosting aislado o sin salidas, autenticación por usuario con permisos por rol, logs de auditoría inmutables, cifrado en reposo y en tránsito, trazabilidad determinista chunk→fuente, y vía de borrado que propague por el índice.

### 3.4 Orquestación de flujos
- **n8n** — el Zapier self-hosted: nodos AI nativos que conectan directamente con Ollama; se integra con correo, webhooks, APIs, bases de datos y domótica. **Sin coste por ejecución**.
- **LangChain / LangGraph / CrewAI** — frameworks para agentes multi-paso y flujos con estado.
- **LiteLLM** — pasarela unificada: un solo endpoint que enruta entre modelos locales y externos, con control de gasto y límites por usuario. "Cambias de modelo en un archivo de configuración".

### 3.5 Voz y multimodal
- **Whisper / Whisper.cpp** (STT) — la mejor transcripción open source; Whisper Large-v3 roza 95% WER en español. Local y gratis.
- **Piper / Coqui TTS** (TTS) — texto a voz en local.
- **LLaVA / Qwen-VL** — visión: describir y responder sobre imágenes.
- **ComfyUI / Stable Diffusion** — generación de imágenes en local.

### 3.6 Asistentes de código y agentes
- **Continue.dev / Cline / Aider** — autocompletado y agentes de código conectados a tu LLM local.
- **OpenClaw y clones self-hosted** — agentes personales que se integran con Telegram/WhatsApp/Discord y ejecutan tareas sobre tus datos.

---

## 4. Flujos de trabajo para EMPRESAS (problemas reales)

### 4.1 Atención al cliente con RAG sobre documentación interna
**Problema:** el equipo de soporte pierde horas buscando en manuales y FAQs; el chatbot de la web alucina si no tiene contexto.
**Flujo:** indexar (manuales, actas, políticas, historial resuelto) → RAG → el agente responde citando la fuente → si no hay confianza, deriva al humano.
**Caso real:** Banco Santander redujo ~40% las consultas que llegan a agentes humanos con su chatbot. **En local**, la ventaja es que el historial de clientes nunca sale de la red.

### 4.2 Procesado de documentos sensibles (contratos, facturas, informes)
**Problema:** extraer datos de cientos de PDFs (facturas, contratos, nóminas) a mano.
**Flujo:** carpeta de entrada → el LLM extrae campos estructurados (JSON) → validación → base de datos → informes automáticos.
**Por qué local:** estos documentos contienen datos personales y secretos; enviarlos a una API de terceros es un riesgo de cumplimiento.

### 4.3 Soporte interno de TI (IT helpdesk)
**Problema:** el departamento de sistemas repite respuestas (VPN, impresora, licencias).
**Flujo:** documentación interna + RAG → chatbot de intranet (Open WebUI o bot de Teams) → resuelve el 60-80% primera línea → escala lo complejo.

### 4.4 Legal: revisión de contratos y cumplimiento
**Problema:** abogados leen contratos largos para detectar cláusulas anómalas.
**Flujo:** carga de contrato → resumen + detección de cláusulas de riesgo (indemnización, no competencia, renovación automática) → checklist comparado con plantilla estándar.
**Local = obligatorio** en muchos casos por secreto profesional y GDPR.

### 4.5 Salud: transcripción clínica y resúmenes
**Problema:** los profesionales dedican horas a escribir notas tras cada consulta.
**Flujo:** audio de consulta (con consentimiento) → Whisper transcribe → LLM genera nota estructurada (síntomas, diagnóstico, plan) → revisión del facultativo.
**Caso tipo:** clínicas usan IA self-hosted para comunicación con pacientes, citas y documentación interna **sin exponer PHI** (HIPAA).

### 4.6 Finanzas: conciliación, informes y análisis
**Problema:** conciliar datos entre sistemas y redactar informes de gestión consume días al mes.
**Flujo:** extracción de datos → LLM cruza y resalta discrepancias → borrador de informe / comentario de variaciones → humano valida.

### 4.7 Marketing y contenido
**Problema:** producir variaciones de texto, traducciones y publicaciones para muchos canales.
**Flujo:** documento Word → LLM local → presentación, resumen o adaptación por canal. Horas ahorradas por pieza.

### 4.8 Fabricación / logística: captura de datos de documentos
**Problema:** albaranes, inspecciones y partes en papel.
**Flujo:** foto/escaneo → visión (LLaVA) o STT → datos estructurados → ERP.

### 4.9 Arquitectura tipo para una empresa (patrón)
```
[Usuarios] → Open WebUI / Bot interno
                 │
                 ▼
            [LiteLLM] ── un solo endpoint ──► [Ollama / vLLM] (modelos locales)
                 │
                 └────────► [Qdrant] (RAG sobre documentos internos)
                 └────────► [n8n] (flujos: correo, ERP, informes)
```
Todo dentro de la red corporativa. Cero datos fuera.

---

## 5. Flujos de trabajo para PERSONAS (problemas reales)

### 5.1 Transcripción y resumen de reuniones
**Problema:** llegan las reuniones, se pierden las decisiones y las tareas.
**Flujo:** grabar (o Meetily/whisper directo) → transcripción local → resumen + tareas pendientes → correo automático.
**Herramientas:** Meetily (100% local, GDPR/HIPAA por diseño, gratis Community) o Whisper + plantilla de prompt.
**Consejo de los prácticos:** "transcribir local, resumir con el local que tengas" — y si algún día necesitas la nube, la transcripción local ya asegura que el audio crudo no se expone.

### 5.2 Asistente personal sobre tus propios archivos
**Problema:** tus notas, PDFs, correos y enlaces están dispersos y no puedes "preguntarles".
**Flujo:** carpeta de documentos → índice local (AnythingLLM/PrivateGPT) → chat: "¿qué decía el contrato del piso?", "resume mis apuntes de marzo".
**Casos de uso personal típicos** (de asistentes self-hosted): gestión de tareas y agenda, ayuda con código y revisión, escritura y edición larga, resumen de investigaciones, aprendizaje de idiomas y traducción, gestión de correo (draft + triaje), conocimiento personal, salud y fitness, lluvia de ideas creativa.

### 5.3 El stack homelab completo (persona técnica)
**Problema:** "quiero automatizar mi vida digital sin pagar suscripciones ni ceder datos".
**Stack de referencia 2026:** Ollama + LiteLLM (un solo endpoint, router que decide modelo grande/pequeño) + Open WebUI (chat) + n8n (automatizaciones) + Qdrant (memoria/vectores) + backups programados (pg_dump/Langfuse/Grafana).
**Ejemplos de flujos n8n sin nube:**
- Nuevo correo → clasificar (urgente/leer/archivar) → borrador de respuesta.
- Webhook de formulario → registrar + LLM rellena ficha → notificación.
- Podcast/audio nuevo → transcribir → resumir → guardar en notas.
- Feed RSS → resumen semanal en un chat.

### 5.4 Voz local completa: STT + LLM + TTS
**Flujo estrella** (el mismo que querías montar en el lab):
```
Audio/podcast ─► Whisper (transcripción) ─► LLM local (resumen / traducción) ─► Piper TTS (audio final)
```
Cada paso es un servicio local invocable por API; se encadena con un orquestador (n8n o un script). Es exactamente el patrón **tarea de varias fases con datos de entrada/salida encadenados** que diseñamos para tu lab.

### 5.5 Estudio e idiomas
- Traducción de artículos al instante, práctica de conversación con un modelo local que no juzga.
- **Conexión con tu caso:** el flujo "buscar libro → EPUB → MOBI" (skill `buscar-libros-biblioteca-secreta`) se puede encadenar: libro → resumen local → audio local para escucharlo.

### 5.6 Salud y hábitos personales
- Análisis de datos de actividad/sueño (CSV de reloj/pulsera) con LLM local: "¿qué correlaciones hay?".
- Registro de comidas → valoración nutricional (patrón de tu proyecto NumiMercadona).

---

## 6. Patrones de diseño que se repiten

1. **RAG (pregunta a tus datos):** documentos → chunks → embeddings → vector DB → recuperación + contexto → respuesta citada.
2. **Pipeline secuencial:** entrada → transformación (STT/extracción) → LLM → transformación (TTS/JSON) → salida. *Las fases encadenadas se comportan como las tareas con `next_action` de tu lab: cada paso consume la salida del anterior.*
3. **Agente con herramientas:** LLM decide qué llamar (buscar, calcular, escribir) encadenando APIs locales.
4. **Gateway único:** LiteLLM/LocalAI para que TODAS las apps hablen con un solo endpoint y cambiar de modelo sea un config.

---

## 7. Hardware y modelos recomendados

| Presupuesto | Hardware | Modelos recomendados | Uso |
|---|---|---|---|
| Mínimo | CPU 8-16 GB RAM (o Raspberry Pi 5 / Orange Pi) | Qwen2.5 1.5B-7B, Llama 3.2 3B, Phi-3.5 mini, Whisper small | Transcripción, resúmenes cortos, clasificación |
| Intermedio | PC 16-32 GB RAM + GPU 8-12 GB | Llama 3.1 8B, Mistral 7B, Qwen2.5 7B-14B, DeepSeek R1 7B distil | RAG, chat de empresa, agentes |
| Alto | 64 GB+ RAM + GPU 24 GB+ | Llama 3.3 70B, Qwen2.5 32B, DeepSeek R1 32B | Producción con vLLM, área entera |

*Regla práctica:* el modelo cabe si sus parámetros (en miles de millones) × ~1GB ≈ tu VRAM/RAM disponible. En CPU puro, los modelos ≤8B en cuantización Q4 son fluidos.

---

## 8. Costes

| Concepto | Nube (ej. GPT-4o clase) | Local |
|---|---|---|
| Uso mensual moderado | 20-60 €/usuario/mes | 0 € (hardware ya pagado) |
| Datos sensibles fuera | ⚠️ Sí (riesgo GDPR) | No (nunca salen) |
| Límites / rate limits | Sí | No |
| Offline | No | Sí |
| Amortización hardware | — | 6-18 meses según uso |

*Ahorro típico publicado:* un stack homelab n8n+Ollama cuesta ~0 €/mes frente a Zapier+OpenAI.

---

## 9. Riesgos y limitaciones (ser honestos)

- **Calidad**: los modelos locales grandes (70B+) se acercan a la nube; los pequeños alucinan más y con menos contexto. Elegir modelo según tarea.
- **Mantenimiento**: actualizar modelos, parchear, vigilar disco (los modelos pesan 4-40 GB cada uno).
- **Seguridad del propio host**: si el servidor cae o es hackeado, los datos están ahí — cifrar en reposo, permisos por rol, auditoría.
- **Curva de montaje**: el stack completo (Ollama+Open WebUI+n8n+Qdrant+LiteLLM) es Docker; hay plantillas `docker compose` listas (p. ej. local-ai-packaged) que lo montan en minutos.
- **No "enterarse de lo último"**: un modelo local fijo no sabe noticias; combinar con búsqueda web o RAG actualizado cuando haga falta.

---

## 10. Guía de implantación en 6 fases

1. **Fase 0 — Prueba de concepto (1 tarde):** instalar Ollama, `ollama run llama3.2:3b`, probar en LM Studio o Open WebUI. Criterio: ¿el resultado es útil para UNA tarea concreta?
2. **Fase 1 — Piloto (1 semana):** elegir UN flujo de valor (el más repetitivo y con datos propios). RAG sobre ese corpus. Medir: tiempo ahorrado, % de respuestas válidas.
3. **Fase 2 — Producto:** pasar a vLLM o LocalAI, añadir LiteLLM como gateway, autenticación por usuario, logs.
4. **Fase 3 — Orquestación:** n8n conecta correo, ERP, notificaciones. Automatizar el flujo completo.
5. **Fase 4 — Ampliar:** segundo y tercer flujo (voz, informes, soporte). Reutilizar el mismo stack.
6. **Fase 5 — Gobernanza:** quién puede ver qué, qué se elimina y cuándo, copias de seguridad, registro de auditoría.

---

## 11. Referencias (fuentes de esta investigación)

- PromptQuorum — *Local RAG for Private Business Data* (6 controles GDPR) y *88 herramientas LLM local 2026*.
- Red Hat — *vLLM vs Ollama*; *vLLM: 3 casos de empresa*.
- DEV Community — *The Homelab AI Stack in 2026*; *Homelab AI stack: qué correr y en qué orden*.
- Meetily — documentación y guías de transcripción de reuniones self-hosted.
- OpenClaw/OneClaw — *Personal AI Agent Use Cases*; *Self-Hosted AI Agent Complete Guide 2026*.
- Vellum — *8 mejores asistentes personales open source 2026*.
- Javadex — ranking transcripción 2026 (Whisper Large-v3 95,2% WER en español; Deepgram; Otter).
- Apreder21 / Microsoft Industry — casos de éxito con IA generativa (Santander, marketing y finanzas con Copilot).
- AyAutomate / ToolJunction / Meshworld — stacks self-hosted 2026 (Ollama + Open WebUI + n8n + Qdrant + LiteLLM).

---

*Documento generado por Manolín 🦴 · Investigación con fuentes públicas de 2025-2026 · Desplegado en la infraestructura del Gran Jefe.*