Apu AIan ID4 product
IA privada · On-premise

Inteligencia artificial que vive en tu infraestructura.

Tus datos no salen de tu red y el modelo se afina a tu operación. Apu AI es la línea de IA privada de ID4 — lo que en el sector público se conoce como IA soberana — con modelos open-weight desplegados llave en mano en tu propia infraestructura. Lee, razona y actúa sobre tus sistemas corporativos (ERP, CRM, BDs, documentos, correos) — y también sobre dato físico de IoT cuando tu caso combina ambos mundos. Se integra con ControlOne cuando lo necesitas, o corre standalone.

Resumen ejecutivo · Para tu directorio en 30 segundos

IA empresarial en tu propia casa — control del dato, riesgo acotado, despliegue en semanas.

El dato no sale de tu perímetro

Tus datos operativos, comerciales y regulados se procesan dentro de tu infraestructura, y los pesos del modelo también. Menos transferencias que justificar ante el regulador, la auditoría o tu directorio.

Especializado en tu operación

Fine-tuning con tu vocabulario, tus procesos y tus decisiones históricas. En una tarea concreta, un modelo afinado rinde mejor que un gigante genérico — y cuesta una fracción de lo que cuesta operarlo.

Llave en mano, bajo gobierno técnico

Setup, modelos open-weight, fine-tuning con tus datos, guardrails de seguridad y ciclo MLOps auditable. Alineado con NIST AI RMF, ISO 42001 y OWASP LLM Top 10. De piloto a operación en semanas.

Por qué Apu AI

Tres ventajas que no negociamos.

Control verificable del dato

0

datos saliendo de tu red

Modelos open-weight desplegados en tu infraestructura. Tu información y los pesos del modelo permanecen en tu perímetro — y puedes auditar quién accede a qué.

Afinado a tu dominio

1

modelo entrenado en lo tuyo

Fine-tuning con tu vocabulario, tus procesos y tus decisiones históricas. En la tarea para la que se entrenó, supera al modelo genérico de propósito general.

Costo predecible

0

cobro por consulta

Inversión definida más operación de costo fijo, en lugar de una factura que crece con el uso. Cuánto conviene frente a la nube depende de tu volumen: lo calculamos con tus números.

El punto

Dónde vive tu dato, sin que tengas que creernos.

La promesa de la IA privada cabe en una frase — tus datos no salen de tu red — pero una frase se firma igual de fácil se cumpla o no. Esto es lo que significa en la práctica.

  • Dentro del perímetro

    El modelo, los documentos, los prompts y las respuestas circulan en tu infraestructura. Ahí ocurre todo el trabajo.

  • El límite es el límite

    Lo que llega de fuera se detiene en el borde. No hay un flujo de salida que justificar ante una auditoría, porque no existe.

  • Y si te vas, te llevas todo

    Los pesos del modelo, los índices y los registros son tuyos. No quedan alojados en un servicio ajeno.

¿Y cómo se comprueba que un proveedor cumple esto? Con las doce preguntas del Test de Control.

Tu redLa nube

CAPEX vs OPEX

Apu AI vs. IA en la nube tradicional.

La comparación que tu CFO va a pedir cuando le presentes la propuesta.

Aspecto
Cloud tradicional
Apu AI On-Premise
Estructura de costo
Variable: crece con el uso
Fija: inversión + operación conocida
Costo por consulta
Se cobra cada consulta
Sin cobro por consulta
Dónde viven tus datos
Salen de tu red
Permanecen en tu red
Dónde viven los pesos del modelo
En el proveedor
En tu infraestructura
Disponibilidad
Requiere internet estable
Funciona offline, baja latencia
Personalización con tus datos
Limitada
Fine-tuning completo
Evidencia para el auditor
Depende del proveedor
Trazas y accesos bajo tu control
Dependencia de proveedor
Atado al proveedor cloud
Open-weight: modelo reemplazable
Latencia en operaciones críticas
Variable + límites de rate
Predecible y consistente
Capacidad frontier del momento
Siempre el último modelo
Unos meses por detrás de la frontera
Conviene cuando…
Volumen bajo o esporádico
Volumen alto, dato sensible o regulado

¿Cuál conviene en tu caso?

La respuesta honesta depende de tu volumen.

Con uso alto y sostenido, o con datos que no pueden salir de tu red, el on-premise se paga solo. Con volumen bajo o esporádico, la nube suele ser la mejor opción — y te lo vamos a decir. Modelamos tu escenario con tus números reales en el diagnóstico.

Modelar mi escenario

Capacidades

Seis capacidades, una plataforma común.

Cada capacidad se compra por separado o como suite integrada. Misma infraestructura, mismos modelos, distintos casos de uso.

Agentes Conversacionales

Chatbots multimodales integrados con WhatsApp, web, Telegram y llamadas telefónicas (speech-to-speech). Atención al cliente, soporte interno, asistencia comercial.

WhatsApp BusinessWeb chatTelegramSpeech-to-speech

RAG / Análisis Documental

Tu IA responde con precisión sobre tus propios documentos: contratos, manuales, históricos, reportes técnicos, normativa interna. Sin filtrado de información sensible.

Manuales técnicosContratosReportes históricosNormativa

Avatares Conversacionales

IA con presencia visual y voz para venta directa, soporte y atención. Multimodal nativo: ve, escucha, responde. Roadmap activo en Apu AI.

Venta directaSoporte 24/7OnboardingAtención al cliente

Orquestadores de Procesos

Agentes que ejecutan flujos completos con múltiples herramientas: leer correo, consultar ERP, generar reporte, notificar a Slack, escalar a un humano.

Email triageERP integrationReportes autoEscalamiento

Fine-Tuning con tus datos

Adaptamos los modelos open-weight a tu dominio específico: vocabulario interno, procesos propios, decisiones históricas. Resultado: respuestas que parecen escritas por tu mejor empleado.

Dominio específicoVoz de marcaProcesos propios

Multimodal nativo

Voz, texto, imagen y video procesados en la misma plataforma. Sin orquestar 3 servicios distintos: una sola IA que entiende todo.

Voz a textoAnálisis de imagenVideo understandingOCR avanzado

Cómo funciona

Tu infraestructura. Nuestros modelos. Cero atadura.

Stack desplegado

Hardware

NVIDIA H100 (recomendación inicial). Escalable a H200, B200, L40S según carga.

Infraestructura

Tu data center, tu cloud privada o servidor on-premise. Linux Ubuntu / RHEL / CentOS.

Modelos open-weight

Familias Qwen, DeepSeek, Llama, Gemma, GLM y gpt-oss. Priorizamos licencias permisivas (Apache 2.0, MIT); el catálogo se revisa con cada versión relevante.

RAG y embeddings

Vector stores on-premise: Qdrant, Weaviate o Pinecone self-hosted. Tus documentos nunca salen.

Integraciones

APIs REST + webhooks. Conectores nativos: WhatsApp Business, Telegram, Slack, Microsoft Teams, ERP (SAP, Oracle), CRM, bases de datos SQL/NoSQL.

Seguridad

TLS extremo a extremo, audit logs completos, control de acceso por rol. Compatible con políticas SOC 2, ISO 27001.

Flujo end-to-end

  1. 1Diagnóstico técnico: levantamos infraestructura existente, casos de uso, datos disponibles.
  2. 2Diseño y propuesta: arquitectura específica para tu caso, costeo de GPUs, modelos seleccionados.
  3. 3Instalación on-premise: despliegue del stack en tu infraestructura, hardening de seguridad.
  4. 4Fine-tuning con tus datos: adaptamos los modelos a tu vocabulario, procesos, decisiones históricas.
  5. 5Integración con tus sistemas: conectores a ERP, CRM, WhatsApp, web, lo que necesites.
  6. 6Capacitación + handover: tu equipo opera. Nosotros damos soporte según el tier elegido.

Tiempo total

4 a 12 semanas

desde kickoff hasta producción

MLOps + Safety · Gobierno de modelos

Calidad y safety de modelos en producción real.

La diferencia entre un demo brillante y una IA productiva está en cómo se evalúa, versiona, protege y opera. Apu AI no es un piloto: es infraestructura de IA bajo gobierno técnico.

Evaluación continua

Cada modelo en producción se evalúa contra datasets dorados construidos con el cliente. Métricas reales — no benchmarks sintéticos genéricos. Drift detection cuando el comportamiento del modelo cambia respecto al baseline. Sin evaluación medible, no se opera.

Golden datasetsRAG eval (faithfulness · relevancy)Drift detectionLatencia P95/P99

Safety & Guardrails

Cada flujo de IA tiene capas de protección activas: bloqueo de prompt injection, redacción automática de PII en entrada y salida, filtrado de output tóxico o inseguro, defensa contra jailbreak. Lo que entra al modelo está controlado; lo que sale del modelo está filtrado.

Prompt injection defensePII redactionOutput filteringJailbreak prevention

Versionado y reproducibilidad

Cada modelo en producción es trazable: versión exacta, dataset de fine-tuning, hiperparámetros, semilla de entrenamiento. Si la IA falla, revertimos en minutos — no en semanas. A/B testing y canary deployments antes de promover a producción.

Model registryA/B testingCanary deploymentsRollback en minutos

Frameworks agénticos auditables

Los agentes IA se construyen sobre frameworks abiertos: LangGraph para flujos multi-paso, MCP (Model Context Protocol) para integración con herramientas, orquestación multi-agente cuando el caso lo requiere. Cada acción del agente queda trazada — herramienta usada, argumentos, resultado.

LangGraphMCPMulti-agent orchestrationTool use auditable

Ciclo de vida del modelo

Cada modelo recorre un ciclo definido. Y cada paso es auditable.

Desde el dataset inicial hasta el modelo desplegado, cada paso del ciclo de vida queda registrado, versionado y reproducible. El modelo no se “sube y olvida” — se observa, se mide y se reentrena cuando los datos del mundo real cambian respecto a los datos con los que fue entrenado.

Esta disciplina es lo que separa MLOps de un experimento de IA.

01 DATASETcurado · versionado02 FINE-TUNELoRA · hiperparámetros03 EVALUATEgolden set · métricas04 GUARDRAILSPII · prompt injection05 DEPLOYcanary · A/B06 MONITORlatencia · drift · logs07 DRIFT DETECTADO → RE-EVALUACIÓN AUTOMÁTICA → RE-ENTRENAMIENTO O ROLLBACKel ciclo se cierra · y se reabre cuando el mundo cambiaCiclo continuo · cada paso versionado, auditable y reversible

Alineamiento con frameworks de gobierno IA

NIST AI RMF · ISO/IEC 42001 · OWASP LLM Top 10 · MITRE ATLAS.

Nuestro marco MLOps se construye sobre los estándares internacionales de gobierno de IA. NIST AI Risk Management Framework orienta el ciclo de vida del modelo y la gestión de riesgo. ISO/IEC 42001 aporta el marco de gestión de sistemas IA. OWASP LLM Top 10 guía la defensa contra ataques específicos a modelos de lenguaje (prompt injection, training data poisoning, model DoS). MITRE ATLAS describe el threat landscape adversarial específico de sistemas IA.

Estos no son adornos académicos: son los principios que un CISO, un CDO y un comité de auditoría de IA van a buscar en cualquier propuesta seria de IA empresarial en 2026.

NIST AI RMF

Gestión de riesgo IA

ISO 42001

Gestión de sistemas IA

OWASP LLM Top 10

Defensa específica LLM

MITRE ATLAS

Threat landscape IA

MLOps es disciplina especializada en evolución rápida. ID4 opera con principios, herramientas y prácticas alineados a los frameworks de referencia — y adapta las prácticas específicas según el caso de uso, el riesgo del cliente y la regulación aplicable.

Niveles de servicio

Tres tiers, según cuánto soporte necesitas.

Todos incluyen la infraestructura Apu AI operativa. La diferencia está en SLA, horas de equipo dedicado y nivel de co-desarrollo.

Essential

Mantenimiento

SLA

8 horas

Consultoría

4 horas / mes

  • Actualizaciones de modelos y plataforma
  • Hardening y parches de seguridad
  • Reporte mensual de uso y desempeño
  • Soporte por ticket
Cotizar Essential
Más elegido

Advanced

Optimización

SLA

4 horas

Consultoría

10 horas / mes

  • Todo lo de Essential, más:
  • Científico de datos dedicado por horas asignadas
  • Optimización continua de prompts y modelos
  • Roadmap prioritario de capacidades nuevas
  • Soporte por ticket + chat
Cotizar Advanced

Strategic

Alianza estratégica

SLA

1 hora

Consultoría

20 horas / mes

  • Todo lo de Advanced, más:
  • Monitoreo proactivo 24/7
  • Consultor senior dedicado
  • Co-desarrollo de capacidades a medida
  • Roadmap conjunto trimestral
  • Soporte multicanal incluido WhatsApp directo
Conversar Strategic

Servicios profesionales adicionales disponibles en todos los planes: Data Scientist, ML Engineer, Data Engineer, Project Manager — bajo bolsa de horas.

Caso de éxito · Retail

Coolbox: agentes IA de soporte a la venta, sin costo por token.

El reto

Coolbox necesitaba escalar la atención y soporte comercial sin disparar costos variables de IA cloud, manteniendo los datos sensibles de cliente dentro de su red.

La solución Apu

Despliegue de IA agéntica on-premise con Apu AI: agentes conversacionales que asisten al equipo comercial en tiempo real. Roadmap activo: avatares conversacionales para atención directa al cliente.

El resultado

$0

costo por token. CAPEX fijo, presupuesto predecible.

Datos siempre dentro de la red de Coolbox. Métricas completas se actualizarán cuando se documenten formalmente.

¿Tu caso es parecido? Conversemos cómo Apu AI encaja en tu operación.

Agendar diagnóstico

Sectores

Dónde Apu AI ya está generando valor.

Retail

Agentes conversacionales, análisis de imágenes de producto, atención 24/7.

Manufactura

Control de calidad con visión, workflows operativos automatizados.

Salud

Análisis de reportes clínicos, gestión documental médica, RAG sobre normativa.

Finanzas

Gestión documental avanzada, cumplimiento regulatorio automatizado.

Educación

Asistentes conversacionales, análisis documental, workflows institucionales.

Sector público

RAG sobre normativa interna, atención ciudadana, gestión documental.

Preguntas frecuentes

Lo que más nos preguntan.

¿Esto es lo mismo que "IA sin nube" o "IA en servidor propio"?

Sí, es lo mismo: son los nombres que suele usar quien busca esto por primera vez. También lo verás como IA local, IA on-premise y, en el sector público, IA soberana. Nosotros lo llamamos IA privada porque nombra lo que de verdad importa —quién controla el dato y el modelo— en lugar de nombrar lo que falta, que es la nube. Un matiz que conviene aclarar antes de que se convierta en una expectativa equivocada: "sin nube" no significa "sin internet". El sistema puede estar perfectamente conectado; lo que no sale de tu red son tus datos y los pesos del modelo. Si además lo necesitas aislado por completo, también se puede — y entonces hablamos de un despliegue air-gapped.

¿Llama, Qwen y Gemma son open source?

No exactamente, y la distinción importa cuando el modelo va a correr en tu casa. Son modelos open-weight: publican los pesos —que puedes descargar, inspeccionar y ejecutar en tu propia infraestructura— pero no los datos ni el código de entrenamiento, y algunos traen licencias con restricciones de uso. Según la definición formal de la Open Source Initiative, eso no califica como open source. Casi todo el mercado los llama así igual, empezando por quien los publica; nosotros lo aclaramos en vez de repetirlo, porque tu área legal necesita saber exactamente qué licencia está firmando. Por eso priorizamos las familias con licencia permisiva (Apache 2.0, MIT).

¿Y si los modelos open-weight se quedan atrás de GPT, Claude o Gemini?

Se quedan atrás, sí — y conviene decirlo con número: la medición de Epoch AI (mayo 2026) sitúa a los mejores modelos abiertos unos 4 meses por detrás de la frontera cerrada, una distancia que se ha mantenido estable en el tiempo. Para razonamiento de frontera o agentes de horizonte muy largo, esa diferencia importa. Para el grueso del caso empresarial —RAG documental, extracción, clasificación, asistentes internos— un modelo abierto afinado a tu tarea rinde igual o mejor que uno genérico de frontera. La decisión no es 'cuál es más inteligente' sino 'cuál resuelve mi tarea con el control que necesito'.

¿Qué nivel técnico necesito tener internamente?

Cero, si vas con un tier Advanced o Strategic. Nosotros operamos la infraestructura, modelos y monitoreo. Tu equipo solo recibe el sistema integrado a sus herramientas (WhatsApp, ERP, etc.) y lo usa. Si quieres traer el conocimiento in-house, capacitamos a tu equipo en paralelo.

¿Funciona offline?

Sí. La infraestructura on-premise opera sin conexión a internet permanente. Útil para operaciones críticas (mineras subterráneas, plantas industriales, hospitales) donde la conectividad no es garantizada.

¿Cómo se actualizan los modelos?

Cuando aparece un modelo open-weight relevante (la frontera abierta se mueve cada pocos meses), te avisamos, evaluamos si aporta a tu caso de uso, y actualizamos sin cobro adicional dentro del SLA del tier. La infraestructura GPU sigue igual.

¿Qué TCO real tengo comparado con OpenAI o Anthropic?

Depende de tu volumen y de qué tan sostenido sea el uso, y no vamos a darte un porcentaje que envejezca mal: los precios de las APIs han bajado con fuerza en el último año y siguen moviéndose. La regla práctica: con volumen alto y utilización constante, el on-premise gana; con volumen bajo o a ráfagas, la nube suele salir mejor. Hay un factor que la comparación de precio no captura y suele ser el decisivo: si tus datos no pueden salir de tu red, la nube no es una opción más barata — es una opción que no aplica. Modelamos tu caso con tus números en el diagnóstico.

¿Puedo entrenar con mis propios datos sin que salgan de mi red?

Sí. El fine-tuning es 100% on-premise. Tus documentos, conversaciones, datos transaccionales nunca salen de tu infraestructura. Es la diferencia más crítica vs cualquier solución cloud.

¿Qué pasa si necesito escalar a 1000 usuarios concurrentes?

Agregamos GPUs adicionales a tu infraestructura. La arquitectura es modular: arrancas con 1-2 H100 y escalas según demanda. Sin renegociar contrato cada vez. Lo dimensionamos contigo antes de comprar nada.

¿Cómo garantizan la seguridad?

TLS extremo a extremo, audit logs completos, control de acceso por rol, hardening del sistema operativo, parches de seguridad continuos. Compatible con políticas internas de SOC 2 e ISO 27001 — el cliente conserva el control completo.

¿Es una entidad del Estado?

Esta misma tecnología, en el idioma del sector público.

Ahí lo llamamos IA soberana: qué significa de verdad —y qué no—, y cinco cláusulas listas para incorporar a un término de referencia.

Ver la versión para el Estado

Tu IA. Tu data. Tu infraestructura.

Agenda 30 minutos con nuestro equipo. Te hacemos un diagnóstico técnico honesto y, si encaja, una propuesta concreta con presupuesto fijo.