Saltar al contenido
Concepto · IA sobre tus datos

ChatGPT adivina qué significan tus datos. Nosotros lo dejamos por escrito.

Conectar ChatGPT a tus datos parece Agentic BI, pero no lo es: el modelo adivina qué significa cada columna y cada métrica, así que dos personas pueden recibir dos números distintos de la misma pregunta. Una capa semántica define cada métrica una sola vez, en código, y hace que la IA responda siempre con la misma definición, la que fija quien conoce tu negocio.

Por Diego A. Fliess · Cofundador y CTO de Kairos Agéntica Actualizado el Lectura de 9 minutos
LA IDEA

El mismo Excel, dos respuestas distintas.

Dos personas le hacen a ChatGPT la misma pregunta: cuántos clientes activos hay. Pegan el mismo Excel. Reciben dos números distintos. Ninguna se da cuenta, porque los dos suenan razonables.

Ese es el problema, y no se arregla con un modelo más listo. ChatGPT no sabe qué significan tus datos. Cada vez que preguntas, adivina: qué columna es el estado, si una baja sigue contando, si un registro con dos categorías es una fila o dos. A veces acierta. A veces cuenta como activos a los que se dieron de baja en marzo. Y como nunca ves la definición que usó, te fías del número.

Un dashboard tampoco cierra ese hueco solo, pero al menos parte de definiciones fijas. Un chat de inteligencia artificial conectado a tus datos en crudo no: improvisa el significado en cada respuesta.

LO QUE YA TRAE CHATGPT

Los conectores oficiales resuelven el acceso. No el significado.

Si llegaste buscando cómo conectar ChatGPT a los datos de tu empresa, la respuesta corta existe: ChatGPT Business y Enterprise traen conectores oficiales y una función llamada Company Knowledge que enlaza Google Drive, SharePoint, Slack o HubSpot en minutos, con permisos por usuario, SSO y cifrado. Para buscar en documentos, contratos y conversaciones internas funciona, y está bien resuelto. Y si hace falta ir más allá, su modo desarrollador conecta por MCP cualquier sistema que lo exponga, también con permiso para escribir.

El límite aparece con los números. Company Knowledge encuentra el documento donde está el dato, y un conector MCP llega hasta la tabla; ninguno de los dos define qué significa el dato. Cuando la pregunta es "¿cuántos clientes activos tenemos?" o "¿qué margen dejó esta línea?", el modelo sigue decidiendo por su cuenta qué cuenta como activo y cómo se calcula ese margen. Es exactamente el problema de la sección anterior, solo que con mejor acceso a las fuentes.

Por eso esta página no va de si conectar o no conectar ChatGPT: va de qué hace falta entre el modelo y tus datos para que los números sean de fiar. Esa pieza es la capa semántica.

LO QUE DICEN LAS MEDICIONES

Un número creíble no es un número correcto.

Cuánto se equivoca un modelo cuando escribe la consulta por su cuenta está medido. Spider 2.0 (en inglés), un banco de pruebas académico presentado en ICLR 2025, lo enfrentó a 632 tareas sacadas de bases de datos empresariales reales, algunas con más de 3.000 columnas. Un agente construido sobre o1-preview, de OpenAI, resolvió el 21,3 %. En el banco de pruebas anterior, con bases mucho más pequeñas, el mismo agente pasaba del 91 %.

En abril de 2026, dbt Labs repitió su propia prueba (en inglés) con Claude Sonnet 4.6 y GPT-5.3 Codex: 11 preguntas, 20 veces cada una. Escribiendo la consulta sobre el esquema original, los modelos acertaron el 64,5 %, casi el doble que en 2023. Con los datos bien modelados subieron al 84-90 %, y a través de una capa semántica, al 98-100 %. Lo más útil del estudio no son los porcentajes, sino cómo falla cada camino: la consulta libre devuelve un número creíble y equivocado, mientras que la capa semántica, cuando una pregunta se sale de lo definido, dice que no puede responder. Un error se ve. Un número falso que suena bien llega a la reunión.

Ese mismo mes, Cube publicó otra medición (en inglés) con tres modelos punteros (Claude Opus 4.7, Claude Sonnet 4.6 y GPT-5.4) y 100 preguntas sobre una base de ventas minoristas. Solo con el esquema, acertaron entre el 45,5 % y el 50,5 %. Con un documento de 4 KB, escrito a mano, que explicaba las métricas y sus reglas, subieron al 67,7-68,7 %. Cambiar de modelo no produjo diferencias significativas; darle contexto, sí.

Dos de estas tres mediciones las firman empresas que venden capa semántica, y conviene leerlas con esa cautela. La tercera es académica y apunta en la misma dirección. Leídas juntas sugieren algo más: un documento con las definiciones ayuda, pero sigue dejando mal una de cada tres respuestas. Lo que se acerca al 100 % es una capa que calcula la métrica ella misma, en vez de dejársela al modelo.

LO QUE HIZO OPENAI

Ni OpenAI conecta ChatGPT directo a sus datos.

En enero de 2026, OpenAI contó cómo construyó su agente de datos interno. Su plataforma de datos atiende a más de 3.500 personas, con más de 600 petabytes repartidos en 70.000 conjuntos de datos. Y el propio equipo lo admite: sin contexto, hasta los modelos más sólidos pueden equivocarse, estimar mal el número de usuarios o malinterpretar la jerga interna.

Por eso no se quedaron en el esquema. Le construyeron seis capas de contexto. Una son anotaciones de expertos con el significado de negocio de cada tabla y sus advertencias conocidas; otra recoge de sus documentos internos las definiciones oficiales de las métricas clave. Lo evalúan contra consultas de referencia escritas a mano, el agente solo ve lo que el usuario ya tiene permiso para ver y, cuando ejecuta una consulta, enlaza a los resultados para poder comprobarlos.

Los empleados lo usan, entre otros sitios, desde ChatGPT, a través de un conector MCP. Es el mismo patrón que proponemos: ChatGPT arriba, y en medio una capa que sabe qué significa cada dato. Si OpenAI lo necesitó con sus propios modelos, tu ERP no lo va a necesitar menos.

QUÉ FALTA EN MEDIO

La capa semántica: el diccionario de tu negocio.

Una capa semántica es el diccionario de tu negocio, escrito una vez y en código: qué es un "cliente activo", qué cuenta como "baja", cómo se prorratea una cuota reducida. No vive en la cabeza de nadie ni se reinventa en cada pregunta. Está definido, revisado y fijo.

Con esa capa delante, el agente deja de improvisar. Pregunta lo que quieras, las veces que quieras: la respuesta usa siempre la misma definición, así que sale igual hoy que mañana y para quien sea. Eso separa "conectar una IA a tus datos" de un BI en el que confías para decidir. No es que la IA sea más lista. Es que ya no adivina.

AspectoChatGPT conectado a tus datosCon una capa semánticaFuente
Qué significa cada métricaLo adivina en cada preguntaDefinido una vez, en códigoCube, 2026
Si preguntas dos vecesPuedes recibir dos respuestas distintasEl mismo número siempreThinking Machines, 2025 · dbt Labs, 2026
Las reglas de tu negocioNo las conoce; las improvisaEscritas y revisadas por quien las conoceOpenAI, 2026
En qué confíasEn un número creíble, esté bien o malEn una definición revisable, que avisa si no sabe responderdbt Labs, 2026
Qué puede tocar el modeloLo que permita la credencial, incluida la escrituraSolo las métricas definidas, en modo lecturaOpenAI · OWASP
PERMISOS

Leer tus datos no es lo mismo que poder cambiarlos.

En su modo desarrollador, ChatGPT no solo lee por MCP: también puede escribir en tus sistemas. La propia OpenAI lo marca como de riesgo elevado (en inglés). Avisa de que una escritura equivocada del modelo puede destruir, alterar o compartir datos, y de que hay conectores maliciosos que intentan robar información.

OWASP (en inglés), el proyecto de referencia en seguridad de aplicaciones, lo llama agencia excesiva y le encuentra tres causas: más funciones de las que la tarea necesita, más permisos de los que necesita y más autonomía de la que conviene. Recomienda permisos mínimos y que una persona apruebe las acciones de alto impacto.

En julio de 2025, los investigadores de General Analysis lo demostraron con el conector MCP de Supabase. Un agente conectado con una credencial que se saltaba la seguridad por filas leyó un ticket de soporte con instrucciones incrustadas y copió en ese mismo ticket la tabla de tokens privados. Simon Willison lo llama la trifecta letal (en inglés): datos privados, contenido de terceros y un canal de salida en el mismo agente. Un ChatGPT con acceso a tu ERP y a tu correo reúne las tres.

Por eso los agentes que montamos leen tus sistemas en modo solo lectura, actúan a través de la API oficial de cada aplicación con los permisos mínimos, y lo que tiene impacto pasa por tu aprobación y queda registrado. Está contado en detalle en la arquitectura de datos para agentes.

DÓNDE ENTRA NUESTRA EXPERIENCIA

Alguien tiene que escribir el diccionario.

Construir la capa semántica es donde conocer el sector paga. Pero antes de escribir una línea hay algo más difícil que el código: lograr que finanzas, marketing y dirección estén de acuerdo en qué significa cada número, y que alguien sea el dueño de esa definición. Esa conversación es la mitad del trabajo.

Saber que en un colegio profesional una baja puede ser un traslado y no una marcha, que un residente paga distinto, que "colegiado" y "colegiado ejerciente" no son lo mismo: eso es lo que se escribe en la capa, una vez, para que el agente lo respete siempre. Traducimos tu negocio a algo que la máquina no pueda malinterpretar, y a partir de ahí la máquina hace el trabajo.

Ahí está el segundo efecto. Si en la capa está definido que el censo se mira por tramo de edad y por tipo, la pregunta "¿va bien?" ya no se contesta con un 2% de crecimiento que esconde una ola de jubilaciones. La lectura correcta viene de serie, porque alguien que sabe la dejó escrita. No depende de que un humano se acuerde de pedirla.

ChatGPT sobre tus datos es un becario brillante que no ha leído tu manual: responde rápido, con seguridad, y a veces mal, sin avisar. La capa semántica es el manual. Nuestro trabajo es escribirlo contigo, para que la IA que se siente encima sea, por fin, de fiar.

Preguntas frecuentes

Lo que suele preguntarse sobre conectar IA a los datos.

¿No basta con conectar ChatGPT a mis datos?

Contesta la pregunta que le haces, pero adivina qué significa cada dato: qué columna es el estado, si una baja cuenta, cómo se calcula una métrica. Por eso dos personas pueden recibir dos números distintos de la misma pregunta. Una capa semántica define cada métrica una sola vez, así que la respuesta es la misma siempre.

¿No me vale con los conectores oficiales de ChatGPT (Company Knowledge)?

Para buscar en documentos y conversaciones internas, sí: es su terreno y lo hacen bien. Para métricas de negocio no resuelven lo importante: el modelo sigue improvisando qué significa cada métrica en cada pregunta. La capa semántica fija esas definiciones una sola vez; los conectores solo mejoran el acceso a las fuentes.

¿Qué es exactamente una capa semántica?

El diccionario de tu negocio, escrito una vez y en código: qué es un cliente activo, qué cuenta como baja, cómo se prorratea una cuota. El agente queda atado a esas definiciones, así que no las improvisa en cada pregunta.

¿Entonces la IA no sirve para analizar mis datos?

Sí sirve, pero sentada sobre una capa semántica. Sin ella improvisa el significado de tus datos y responde rápido, con seguridad y a veces mal. Con ella, la misma IA responde con las definiciones que fija quien conoce tu negocio.

¿Un modelo más potente no lo arregla?

Ayuda, pero no cierra el hueco. En la medición de dbt Labs de 2026, los modelos actuales acertaron el 64,5 % de las consultas que escribieron por su cuenta sobre el esquema original, casi el doble que en 2023; con una capa semántica, entre el 98 % y el 100 %. En la de Cube, cambiar entre tres modelos punteros no produjo diferencias significativas, y darles un documento con las definiciones subió el acierto de cerca del 50 % a cerca del 68 %. Lo que cambia el resultado es el contexto, no el modelo.

¿Es seguro darle a ChatGPT permiso para escribir en mi ERP?

La propia OpenAI marca ese modo como de riesgo elevado: una escritura equivocada del modelo puede destruir, alterar o compartir datos. OWASP recomienda darle al modelo los permisos mínimos y que una persona apruebe las acciones de alto impacto. Si le das escritura, que sea con una credencial limitada y nunca en un agente que además lea contenido de terceros y pueda enviar mensajes hacia fuera.

Para ampliar contexto: Alucinación en IA (Wikipedia) · Qué son los agentes de IA (Google Cloud) · ChatGPT.

Relacionado en Kairos: Del dashboard a la acción: monitorear y actuar · Arquitectura de datos para agentes fiables · Qué es Agentic BI · IA en el control de gestión · Seguridad y datos · Agentic BI en ecommerce · Todos los sectores.

Encaje

Cuándo importa una capa semántica. Y cuándo no.

Importa si

  • Distintas personas sacan números distintos del mismo dato.
  • Nadie sabe con certeza qué cuenta como "cliente activo", "baja" o "margen".
  • Quieres que la IA responda sobre tus datos sin inventarse el significado.
  • Decides con esos números y necesitas poder auditarlos.

Probablemente no la necesitas si

  • Ya tienes una capa de métricas definida y gobernada.
  • Tus preguntas son puntuales y nadie más las repite.
  • Te vale una respuesta aproximada que nadie va a auditar.
  • No conectas IA a tus datos ni piensas hacerlo.

¿Tus datos significan lo mismo para todos los que preguntan?

En 30 minutos vemos tus fuentes, las definiciones que cada quien interpreta a su manera y por dónde una IA fiable mejoraría tu toma de decisiones.

Reservar diagnóstico de 30 minutos