Conectores — Ingesta Toda fuente entra por un conector.
Los conectores extraen el dato de los sistemas de origen: bases de datos, CRM, ERP, correo, ficheros, voz. Cada conector se declara por configuración y queda versionado junto al resto del proyecto.
Desde la ingesta, el dato se clasifica por naturaleza: estructurado —registros y tablas— y no estructurado —documentos, llamadas, correos. Cada naturaleza sigue su propio camino de procesamiento.
EstructuradoNo estructuradoConfiguración declarativa
Pipeline — Transformación De raw a curated, por capas.
El dato atraviesa capas de transformación definidas por proyecto: extracción, normalización, limpieza, enriquecimiento. Cada capa deja el dato más completo y más consistente que la anterior.
En cada paso se registra el linaje atómico: origen, fecha y transformaciones de cada dato individual. El esfuerzo se paga una vez, en la entrada — y hace trazable todo lo que se construye encima.
raw → curatedLinaje atómicoFases por proyecto
Estructurado — Identidades La resolución de entidades unifica cada identidad.
Del dato estructurado emergen las identidades del negocio. La resolución de entidades reconoce que cliente 4471 en el CRM, CUST-4471 en el ERP y c_4471 en un fichero refieren a la misma identidad, y el dedup las funde en una.
El resultado es un catálogo de identidades únicas —clientes, pedidos, contratos— con sus atributos consolidados y su linaje completo.
Resolución de entidadesDedupIdentidades únicas
No estructurado — Corpus + metadatos Cada corpus, ligado a sus metadatos.
El contenido se organiza por corpus —llamadas, informes, contratos— y cada instancia se procesa para inferir sus metadatos: a qué cliente refiere, de qué fecha es, qué tema trata.
Ese anclaje a metadatos convierte cada documento en contenido localizable y relacionable: es el punto de unión que la capa semántica usará para conectarlo con las identidades.
CorpusMetadatos inferidosAnclaje
Data Lake Un solo data lake para las dos naturalezas.
Identidades y corpus convergen en un único data lake sobre Iceberg y Lance: el dato estructurado en tablas versionadas, el contenido con sus metadatos en formato vectorial.
Todo el dato curado comparte un mismo plano de almacenamiento, con su linaje y su descripción. El data lake reúne las piezas; la capa siguiente las relaciona.
IcebergLanceEstructurado + corpus
Grafo semántico El grafo relaciona identidades y corpus.
Sobre el data lake emerge el grafo semántico: las identidades se relacionan entre sí —Cliente realiza Pedido— y los corpus se anclan a ellas a través de sus metadatos: una llamada menciona a un cliente; un informe consta en un pedido.
La ontología emerge del dato real: los conceptos y relaciones del grafo describen lo que efectivamente ocurre en los sistemas de la organización.
Relaciones con significadoAnclaje por metadatosOntología del dato real
Dome de seguridad Las políticas se compilan con cada consulta.
Una librería de políticas de acceso gobierna el grafo completo. Cada consulta se compila con la política que aplica —query′ = compile(query, políticaᵢ)— antes de tocar el dato: filas, columnas y contenido quedan filtrados en la propia consulta.
El dome envuelve todo el conocimiento: cada acceso se evalúa contra una política y queda registrado de forma inmutable. La redacción automática extiende el mismo gobierno al contenido: cada respuesta entrega exactamente lo que la tarea justifica.
Compilación de políticasRLS · CLS · redactedAuditoría inmutable
Consumo Una interfaz de consulta: API y MCP.
El conocimiento se consume como algo que se consulta: una pregunta de negocio entra por API o por MCP y devuelve una respuesta construida sobre el grafo, con las políticas ya aplicadas y su linaje hasta el dato de origen.
Personas, IA y sistemas usan la misma interfaz. Cualquier IA, de cualquier proveedor, opera sobre el conocimiento ya construido: recibe el contexto resuelto y dedica su capacidad a la tarea.
APIMCPRespuesta con linaje