La dimensión que faltaba en la calidad del dato: conocimiento y semántica
Añadir Estrategias de Inversión en Google
Este tema no es nuevo para nosotros, siempre hemos buscado acercar los datos a los perfiles de negocio, y eso exige acompañar los activos técnicos con semántica y lenguaje funcional. No basta con saber que un dato existe: hay que entender qué significa y cómo debe interpretarse. No siempre se ha entendido por qué defendíamos ese lenguaje común para democratizar el uso de los datos.
Por ejemplo, una organización puede disponer del indicador “cliente activo” en varios sistemas, pero cada área puede interpretarlo de forma distinta: para Marketing es quien ha interactuado en los últimos meses; para Ventas, un cliente con una oportunidad abierta... El problema no es la falta de datos, sino la ausencia de una definición compartida.
Cuando toda la organización aplica la misma semántica y las mismas reglas de negocio, el dato deja de ser un valor aislado y se convierte en información útil para decidir.
Junto a la exactitud o la actualización, gana peso la claridad del dato: un marco común de significados para interpretarlo sin ambigüedades. Algunos comienzan a llamarlo “clarity”: la capacidad de ofrecer a los sistemas de IA el conocimiento, la semántica y el contexto necesarios para interpretar correctamente la información.
En Serdatia estamos construyendo una plataforma capaz de incorporar fuentes diversas y hacer aflorar su semántica. Así deja de ser algo accesorio y permite que el dato sea útil fuera de los equipos técnicos.
Entrenamiento federado y Espacios de Datos Europeos: la soberanía como arquitectura
Epoch AI estima en unos 300 billones de unidades de texto, o tokens, el contenido público de calidad disponible para entrenar modelos, que podría aprovecharse en gran medida entre 2026 y 2032. Aunque es una proyección, ayuda a explicar por qué la atención se desplaza hacia los datos industriales y sectoriales.
Son datos más valiosos, pero también más dispersos, heterogéneos y sensibles. Centralizarlos sin más no es realista. Aquí encaja el paradigma de los Espacios de Datos Europeos, que la Comisión Europea impulsa en 14 sectores y ámbitos. No son grandes repositorios de datos, sino entornos con reglas de acceso y gobernanza para compartir información de forma controlada.
El aprendizaje federado (llevar el modelo a donde están los datos, no al revés) puede hacer operativo ese principio. El modelo aprende en cada organización usando sus propios datos y solo comparte el conocimiento adquirido, no los datos originales. Por ejemplo, varios hospitales podrían contribuir a mejorar una herramienta de diagnóstico sin necesidad de intercambiar el historial de sus pacientes.
No garantiza por sí solo la privacidad: exige seguridad, trazabilidad y responsabilidades definidas. Pero permite innovar sin centralizar lo que no debe centralizarse. Iniciativas como OpenGPT-X y OpenEuroLLM reflejan la voluntad europea de construir modelos fundacionales soberanos sobre infraestructura distribuida.


