Inteligencia artificial que vive en tu infraestructura.
Tus datos no salen de tu red y el modelo se afina a tu operación. Apu AI es la línea de IA privada de ID4 — lo que en el sector público se conoce como IA soberana — con modelos open-weight desplegados llave en mano en tu propia infraestructura. Lee, razona y actúa sobre tus sistemas corporativos (ERP, CRM, BDs, documentos, correos) — y también sobre dato físico de IoT cuando tu caso combina ambos mundos. Se integra con ControlOne cuando lo necesitas, o corre standalone.
Resumen ejecutivo · Para tu directorio en 30 segundos
IA empresarial en tu propia casa — control del dato, riesgo acotado, despliegue en semanas.
El dato no sale de tu perímetro
Tus datos operativos, comerciales y regulados se procesan dentro de tu infraestructura, y los pesos del modelo también. Menos transferencias que justificar ante el regulador, la auditoría o tu directorio.
Especializado en tu operación
Fine-tuning con tu vocabulario, tus procesos y tus decisiones históricas. En una tarea concreta, un modelo afinado rinde mejor que un gigante genérico — y cuesta una fracción de lo que cuesta operarlo.
Llave en mano, bajo gobierno técnico
Setup, modelos open-weight, fine-tuning con tus datos, guardrails de seguridad y ciclo MLOps auditable. Alineado con NIST AI RMF, ISO 42001 y OWASP LLM Top 10. De piloto a operación en semanas.
Por qué Apu AI
Tres ventajas que no negociamos.
Control verificable del dato
0
datos saliendo de tu red
Modelos open-weight desplegados en tu infraestructura. Tu información y los pesos del modelo permanecen en tu perímetro — y puedes auditar quién accede a qué.
Afinado a tu dominio
1
modelo entrenado en lo tuyo
Fine-tuning con tu vocabulario, tus procesos y tus decisiones históricas. En la tarea para la que se entrenó, supera al modelo genérico de propósito general.
Costo predecible
0
cobro por consulta
Inversión definida más operación de costo fijo, en lugar de una factura que crece con el uso. Cuánto conviene frente a la nube depende de tu volumen: lo calculamos con tus números.
El punto
Dónde vive tu dato, sin que tengas que creernos.
La promesa de la IA privada cabe en una frase — tus datos no salen de tu red — pero una frase se firma igual de fácil se cumpla o no. Esto es lo que significa en la práctica.
Dentro del perímetro
El modelo, los documentos, los prompts y las respuestas circulan en tu infraestructura. Ahí ocurre todo el trabajo.
El límite es el límite
Lo que llega de fuera se detiene en el borde. No hay un flujo de salida que justificar ante una auditoría, porque no existe.
Y si te vas, te llevas todo
Los pesos del modelo, los índices y los registros son tuyos. No quedan alojados en un servicio ajeno.
¿Y cómo se comprueba que un proveedor cumple esto? Con las doce preguntas del Test de Control.
CAPEX vs OPEX
Apu AI vs. IA en la nube tradicional.
La comparación que tu CFO va a pedir cuando le presentes la propuesta.
¿Cuál conviene en tu caso?
La respuesta honesta depende de tu volumen.
Con uso alto y sostenido, o con datos que no pueden salir de tu red, el on-premise se paga solo. Con volumen bajo o esporádico, la nube suele ser la mejor opción — y te lo vamos a decir. Modelamos tu escenario con tus números reales en el diagnóstico.
Capacidades
Seis capacidades, una plataforma común.
Cada capacidad se compra por separado o como suite integrada. Misma infraestructura, mismos modelos, distintos casos de uso.
Agentes Conversacionales
Chatbots multimodales integrados con WhatsApp, web, Telegram y llamadas telefónicas (speech-to-speech). Atención al cliente, soporte interno, asistencia comercial.
RAG / Análisis Documental
Tu IA responde con precisión sobre tus propios documentos: contratos, manuales, históricos, reportes técnicos, normativa interna. Sin filtrado de información sensible.
Avatares Conversacionales
IA con presencia visual y voz para venta directa, soporte y atención. Multimodal nativo: ve, escucha, responde. Roadmap activo en Apu AI.
Orquestadores de Procesos
Agentes que ejecutan flujos completos con múltiples herramientas: leer correo, consultar ERP, generar reporte, notificar a Slack, escalar a un humano.
Fine-Tuning con tus datos
Adaptamos los modelos open-weight a tu dominio específico: vocabulario interno, procesos propios, decisiones históricas. Resultado: respuestas que parecen escritas por tu mejor empleado.
Multimodal nativo
Voz, texto, imagen y video procesados en la misma plataforma. Sin orquestar 3 servicios distintos: una sola IA que entiende todo.
Cómo funciona
Tu infraestructura. Nuestros modelos. Cero atadura.
Stack desplegado
Hardware
NVIDIA H100 (recomendación inicial). Escalable a H200, B200, L40S según carga.
Infraestructura
Tu data center, tu cloud privada o servidor on-premise. Linux Ubuntu / RHEL / CentOS.
Modelos open-weight
Familias Qwen, DeepSeek, Llama, Gemma, GLM y gpt-oss. Priorizamos licencias permisivas (Apache 2.0, MIT); el catálogo se revisa con cada versión relevante.
RAG y embeddings
Vector stores on-premise: Qdrant, Weaviate o Pinecone self-hosted. Tus documentos nunca salen.
Integraciones
APIs REST + webhooks. Conectores nativos: WhatsApp Business, Telegram, Slack, Microsoft Teams, ERP (SAP, Oracle), CRM, bases de datos SQL/NoSQL.
Seguridad
TLS extremo a extremo, audit logs completos, control de acceso por rol. Compatible con políticas SOC 2, ISO 27001.
Flujo end-to-end
- 1Diagnóstico técnico: levantamos infraestructura existente, casos de uso, datos disponibles.
- 2Diseño y propuesta: arquitectura específica para tu caso, costeo de GPUs, modelos seleccionados.
- 3Instalación on-premise: despliegue del stack en tu infraestructura, hardening de seguridad.
- 4Fine-tuning con tus datos: adaptamos los modelos a tu vocabulario, procesos, decisiones históricas.
- 5Integración con tus sistemas: conectores a ERP, CRM, WhatsApp, web, lo que necesites.
- 6Capacitación + handover: tu equipo opera. Nosotros damos soporte según el tier elegido.
Tiempo total
4 a 12 semanas
desde kickoff hasta producción
MLOps + Safety · Gobierno de modelos
Calidad y safety de modelos en producción real.
La diferencia entre un demo brillante y una IA productiva está en cómo se evalúa, versiona, protege y opera. Apu AI no es un piloto: es infraestructura de IA bajo gobierno técnico.
Evaluación continua
Cada modelo en producción se evalúa contra datasets dorados construidos con el cliente. Métricas reales — no benchmarks sintéticos genéricos. Drift detection cuando el comportamiento del modelo cambia respecto al baseline. Sin evaluación medible, no se opera.
Safety & Guardrails
Cada flujo de IA tiene capas de protección activas: bloqueo de prompt injection, redacción automática de PII en entrada y salida, filtrado de output tóxico o inseguro, defensa contra jailbreak. Lo que entra al modelo está controlado; lo que sale del modelo está filtrado.
Versionado y reproducibilidad
Cada modelo en producción es trazable: versión exacta, dataset de fine-tuning, hiperparámetros, semilla de entrenamiento. Si la IA falla, revertimos en minutos — no en semanas. A/B testing y canary deployments antes de promover a producción.
Frameworks agénticos auditables
Los agentes IA se construyen sobre frameworks abiertos: LangGraph para flujos multi-paso, MCP (Model Context Protocol) para integración con herramientas, orquestación multi-agente cuando el caso lo requiere. Cada acción del agente queda trazada — herramienta usada, argumentos, resultado.
Ciclo de vida del modelo
Cada modelo recorre un ciclo definido. Y cada paso es auditable.
Desde el dataset inicial hasta el modelo desplegado, cada paso del ciclo de vida queda registrado, versionado y reproducible. El modelo no se “sube y olvida” — se observa, se mide y se reentrena cuando los datos del mundo real cambian respecto a los datos con los que fue entrenado.
Esta disciplina es lo que separa MLOps de un experimento de IA.
Alineamiento con frameworks de gobierno IA
NIST AI RMF · ISO/IEC 42001 · OWASP LLM Top 10 · MITRE ATLAS.
Nuestro marco MLOps se construye sobre los estándares internacionales de gobierno de IA. NIST AI Risk Management Framework orienta el ciclo de vida del modelo y la gestión de riesgo. ISO/IEC 42001 aporta el marco de gestión de sistemas IA. OWASP LLM Top 10 guía la defensa contra ataques específicos a modelos de lenguaje (prompt injection, training data poisoning, model DoS). MITRE ATLAS describe el threat landscape adversarial específico de sistemas IA.
Estos no son adornos académicos: son los principios que un CISO, un CDO y un comité de auditoría de IA van a buscar en cualquier propuesta seria de IA empresarial en 2026.
NIST AI RMF
Gestión de riesgo IA
ISO 42001
Gestión de sistemas IA
OWASP LLM Top 10
Defensa específica LLM
MITRE ATLAS
Threat landscape IA
MLOps es disciplina especializada en evolución rápida. ID4 opera con principios, herramientas y prácticas alineados a los frameworks de referencia — y adapta las prácticas específicas según el caso de uso, el riesgo del cliente y la regulación aplicable.
Niveles de servicio
Tres tiers, según cuánto soporte necesitas.
Todos incluyen la infraestructura Apu AI operativa. La diferencia está en SLA, horas de equipo dedicado y nivel de co-desarrollo.
Essential
Mantenimiento
SLA
8 horas
Consultoría
4 horas / mes
- Actualizaciones de modelos y plataforma
- Hardening y parches de seguridad
- Reporte mensual de uso y desempeño
- Soporte por ticket
Advanced
Optimización
SLA
4 horas
Consultoría
10 horas / mes
- Todo lo de Essential, más:
- Científico de datos dedicado por horas asignadas
- Optimización continua de prompts y modelos
- Roadmap prioritario de capacidades nuevas
- Soporte por ticket + chat
Strategic
Alianza estratégica
SLA
1 hora
Consultoría
20 horas / mes
- Todo lo de Advanced, más:
- Monitoreo proactivo 24/7
- Consultor senior dedicado
- Co-desarrollo de capacidades a medida
- Roadmap conjunto trimestral
- Soporte multicanal incluido WhatsApp directo
Servicios profesionales adicionales disponibles en todos los planes: Data Scientist, ML Engineer, Data Engineer, Project Manager — bajo bolsa de horas.
Caso de éxito · Retail
Coolbox: agentes IA de soporte a la venta, sin costo por token.
El reto
Coolbox necesitaba escalar la atención y soporte comercial sin disparar costos variables de IA cloud, manteniendo los datos sensibles de cliente dentro de su red.
La solución Apu
Despliegue de IA agéntica on-premise con Apu AI: agentes conversacionales que asisten al equipo comercial en tiempo real. Roadmap activo: avatares conversacionales para atención directa al cliente.
El resultado
$0
costo por token. CAPEX fijo, presupuesto predecible.
Datos siempre dentro de la red de Coolbox. Métricas completas se actualizarán cuando se documenten formalmente.
¿Tu caso es parecido? Conversemos cómo Apu AI encaja en tu operación.
Agendar diagnósticoSectores
Dónde Apu AI ya está generando valor.
Retail
Agentes conversacionales, análisis de imágenes de producto, atención 24/7.
Manufactura
Control de calidad con visión, workflows operativos automatizados.
Salud
Análisis de reportes clínicos, gestión documental médica, RAG sobre normativa.
Finanzas
Gestión documental avanzada, cumplimiento regulatorio automatizado.
Educación
Asistentes conversacionales, análisis documental, workflows institucionales.
Sector público
RAG sobre normativa interna, atención ciudadana, gestión documental.
Preguntas frecuentes
Lo que más nos preguntan.
¿Esto es lo mismo que "IA sin nube" o "IA en servidor propio"?
Sí, es lo mismo: son los nombres que suele usar quien busca esto por primera vez. También lo verás como IA local, IA on-premise y, en el sector público, IA soberana. Nosotros lo llamamos IA privada porque nombra lo que de verdad importa —quién controla el dato y el modelo— en lugar de nombrar lo que falta, que es la nube. Un matiz que conviene aclarar antes de que se convierta en una expectativa equivocada: "sin nube" no significa "sin internet". El sistema puede estar perfectamente conectado; lo que no sale de tu red son tus datos y los pesos del modelo. Si además lo necesitas aislado por completo, también se puede — y entonces hablamos de un despliegue air-gapped.
¿Llama, Qwen y Gemma son open source?
No exactamente, y la distinción importa cuando el modelo va a correr en tu casa. Son modelos open-weight: publican los pesos —que puedes descargar, inspeccionar y ejecutar en tu propia infraestructura— pero no los datos ni el código de entrenamiento, y algunos traen licencias con restricciones de uso. Según la definición formal de la Open Source Initiative, eso no califica como open source. Casi todo el mercado los llama así igual, empezando por quien los publica; nosotros lo aclaramos en vez de repetirlo, porque tu área legal necesita saber exactamente qué licencia está firmando. Por eso priorizamos las familias con licencia permisiva (Apache 2.0, MIT).
¿Y si los modelos open-weight se quedan atrás de GPT, Claude o Gemini?
Se quedan atrás, sí — y conviene decirlo con número: la medición de Epoch AI (mayo 2026) sitúa a los mejores modelos abiertos unos 4 meses por detrás de la frontera cerrada, una distancia que se ha mantenido estable en el tiempo. Para razonamiento de frontera o agentes de horizonte muy largo, esa diferencia importa. Para el grueso del caso empresarial —RAG documental, extracción, clasificación, asistentes internos— un modelo abierto afinado a tu tarea rinde igual o mejor que uno genérico de frontera. La decisión no es 'cuál es más inteligente' sino 'cuál resuelve mi tarea con el control que necesito'.
¿Qué nivel técnico necesito tener internamente?
Cero, si vas con un tier Advanced o Strategic. Nosotros operamos la infraestructura, modelos y monitoreo. Tu equipo solo recibe el sistema integrado a sus herramientas (WhatsApp, ERP, etc.) y lo usa. Si quieres traer el conocimiento in-house, capacitamos a tu equipo en paralelo.
¿Funciona offline?
Sí. La infraestructura on-premise opera sin conexión a internet permanente. Útil para operaciones críticas (mineras subterráneas, plantas industriales, hospitales) donde la conectividad no es garantizada.
¿Cómo se actualizan los modelos?
Cuando aparece un modelo open-weight relevante (la frontera abierta se mueve cada pocos meses), te avisamos, evaluamos si aporta a tu caso de uso, y actualizamos sin cobro adicional dentro del SLA del tier. La infraestructura GPU sigue igual.
¿Qué TCO real tengo comparado con OpenAI o Anthropic?
Depende de tu volumen y de qué tan sostenido sea el uso, y no vamos a darte un porcentaje que envejezca mal: los precios de las APIs han bajado con fuerza en el último año y siguen moviéndose. La regla práctica: con volumen alto y utilización constante, el on-premise gana; con volumen bajo o a ráfagas, la nube suele salir mejor. Hay un factor que la comparación de precio no captura y suele ser el decisivo: si tus datos no pueden salir de tu red, la nube no es una opción más barata — es una opción que no aplica. Modelamos tu caso con tus números en el diagnóstico.
¿Puedo entrenar con mis propios datos sin que salgan de mi red?
Sí. El fine-tuning es 100% on-premise. Tus documentos, conversaciones, datos transaccionales nunca salen de tu infraestructura. Es la diferencia más crítica vs cualquier solución cloud.
¿Qué pasa si necesito escalar a 1000 usuarios concurrentes?
Agregamos GPUs adicionales a tu infraestructura. La arquitectura es modular: arrancas con 1-2 H100 y escalas según demanda. Sin renegociar contrato cada vez. Lo dimensionamos contigo antes de comprar nada.
¿Cómo garantizan la seguridad?
TLS extremo a extremo, audit logs completos, control de acceso por rol, hardening del sistema operativo, parches de seguridad continuos. Compatible con políticas internas de SOC 2 e ISO 27001 — el cliente conserva el control completo.
¿Es una entidad del Estado?
Esta misma tecnología, en el idioma del sector público.
Ahí lo llamamos IA soberana: qué significa de verdad —y qué no—, y cinco cláusulas listas para incorporar a un término de referencia.
Tu IA. Tu data. Tu infraestructura.
Agenda 30 minutos con nuestro equipo. Te hacemos un diagnóstico técnico honesto y, si encaja, una propuesta concreta con presupuesto fijo.