Data lakes en Salud
Los sistemas de salud producen datos todo el tiempo. Cada turno, cada prescripción, cada resultado de laboratorio, cada imagen, cada internación y cada reclamo administrativo deja una huella.
El problema es que esas huellas no siempre tienen la misma forma. Algunas son datos estructurados, como una fecha, un código diagnóstico, un valor de laboratorio o un monto facturado.
Otras son semiestructuradas, como formularios, mensajes HL7/FHIR, archivos XML o JSON, en los que existe cierta organización, pero no siempre una tabla rígida. Y muchas son no estructuradas: notas clínicas en texto libre, imágenes, documentos escaneados, informes narrativos o audios.
Esta diferencia ayuda a distinguir un data warehouse de un data lake. Un data warehouse suele ordenar información ya depurada, transformada y modelada para responder preguntas relativamente estables: tableros de gestión, indicadores, reportes financieros, seguimiento de producción o métricas de calidad. Es decir, primero se define una estructura común y luego se cargan los datos.
Un data lake, en cambio, permite reunir datos heterogéneos, incluso en su formato original, para procesarlos, vincularlos o analizarlos después según distintas necesidades.
Uso en Salud
En salud, esto puede incluir historias clínicas electrónicas, datos administrativos, registros de turnos, datos genómicos, imágenes, resultados de laboratorio, datos poblacionales o información de dispositivos.
Por eso, la idea de data lake aparece cuando la organización necesita integrar fuentes diversas sin reducirlas desde el inicio a un único modelo rígido. Esa flexibilidad puede ser valiosa para investigación, analítica avanzada, inteligencia artificial, vigilancia sanitaria o gestión poblacional.
Pero también introduce un riesgo: si no hay metadatos, reglas de acceso, controles de calidad, interoperabilidad, gobierno de datos y una pregunta organizacional concreta, el data lake deja de ser una infraestructura útil y se convierte apenas en un depósito costoso que nadie usa bien.
En las publicaciones recientes, los data lakes aparecen ante todo como una respuesta a la fragmentación. Algunos trabajos los describen como parte de arquitecturas de big data en salud capaces de integrar información de múltiples fuentes y adaptarse a necesidades específicas, como auditoría, analítica o investigación clínica [1].
Otros muestran experiencias de integración de datos clínicos y genómicos mediante arquitecturas híbridas en la nube, con acceso regulado por flujos de gobernanza y metadatos ricos [2].
Desde la gestión sanitaria, los ejemplos más interesantes son aquellos en los que la arquitectura de datos se conecta con decisiones concretas.
En Río de Janeiro, la construcción de un health data lake formó parte de un ecosistema digital municipal que incluyó digitalización, integración de información y una aplicación para ciudadanos.
El uso reportado se vinculó con turnos, exámenes, vacunación e información regulatoria [3].
En Mississippi, los data lakes y la visualización de datos se plantearon como herramientas para enfrentar problemas de acceso a la atención, planificación de fuerza laboral y toma de decisiones basada en evidencia [4].
Estos casos muestran algo central: el data lake no transforma por sí solo.
Puede ayudar a ver mejor un problema, pero necesita estar conectado con procesos, responsables y decisiones. Si la organización no sabe qué quiere mirar, quién puede consultar los datos, qué decisiones se van a tomar y cómo se evaluará el resultado, la tecnología pierde fuerza.
Otro uso frecuente aparece en investigación clínica y evidencia de mundo real.
Los data hubs y repositorios institucionales permiten acelerar la construcción de cohortes, reutilizar información registrada durante la atención y sostener programas de investigación.
El Neuro Data Hub, por ejemplo, se presenta como una forma de mejorar accesibilidad a datos y capacidades de investigación, aunque también advierte que su implementación puede quedar limitada por requerimientos de infraestructura informática institucional [5].
Iniciativas como DataCastle o los marcos hospitalarios para transformar datos asistenciales en evidencia de mundo real apuntan en la misma dirección: hacer que los datos rutinarios puedan convertirse en evidencia útil para investigación, gestión y aprendizaje organizacional [6, 7].
La aparición de modelos de lenguaje agrega una capa nueva.
Algunos estudios exploran cómo consultar data lakes de salud mediante LLMs sin exponer directamente los datos sensibles.
La promesa es clara: reducir barreras técnicas para que más usuarios puedan hacer preguntas sobre datos complejos. Pero los límites también son claros: campos inventados, búsquedas incompletas y necesidad de control semántico [8, 9]. En otras palabras, la IA puede facilitar el acceso, pero no reemplaza la gobernanza ni la curación de datos.
Las principales desventajas no son solamente tecnológicas.
Los datos de salud fueron producidos para atender, facturar, registrar o coordinar; no siempre para investigar o gestionar. Por eso pueden ser incompletos, inconsistentes, ambiguos o difíciles de comparar.
Un estudio sobre uso secundario de datos de historia clínica electrónica advierte justamente que los datos deben registrarse de manera estructurada y no ambigua, y que hacen falta métodos para medir calidad si se pretende disponer de data lakes confiables [10].
Para un gestor, entonces, la pregunta no debería ser solamente si conviene tener un data lake. La pregunta más útil sería: para qué problema de gestión se construye, qué datos necesita, bajo qué reglas se usarán, quién los valida, quién puede acceder y qué decisiones se esperan mejorar.
Un data lake puede servir para planificar servicios, monitorear resultados, gestionar poblaciones, apoyar investigación, identificar brechas de acceso o mejorar coordinación. Pero solo lo logra si está integrado en una forma de trabajo.
La evidencia disponible deja una conclusión prudente. Los data lakes pueden ser una pieza importante de la salud digital, especialmente cuando ayudan a integrar datos dispersos y convertirlos en información accionable. Pero no son una solución autosuficiente.
Su éxito depende menos del volumen de datos acumulado que de la calidad, la gobernanza, la interoperabilidad, las capacidades analíticas y la madurez organizacional que los rodea.
En síntesis: un data lake no es el lago. Es la infraestructura, las reglas y las capacidades que permiten navegarlo sin perderse.
Referencias
- Helder Prado Santos,MethaniasColaço Júnior, Ricardo Valentim, João Paulo Queiroz Dos Santos, Marcia Elizabeth Marinho da Silva, Luiz Affonso Henderson Guedes de Oliveira, et al.. Scientific and technological mapping of big data architectures in healthcare. Frontiers in public health. 2026. doi:10.3389/fpubh.2026.1775715
- Apollo McOwiti, Heidi Dowst, Fei Zheng, Susan Hilsenbeck, Christopher Amos. Ahybridcloud data lake architecture supporting the integration of clinical and genomics data. Health informatics journal. 2025. doi:10.1177/14604582251353440
- Fernanda Adães Britto, Juliana Paranhos Moreno Batista, Fabiana Lustosa Gaspar, André Luis Paes Ramos, Fernanda Pinheiro Aguiar, Juliana Jenifer da Silva Araújo Cunha,et al..Digital health ecosystem in the municipality of Río de Janeiro, Brazil: the experience of the creation of the minhasaude.rio application. Ciencia & saude coletiva. 2026. doi:10.1590/1413-81232026315.00272026
- Denise D Krause.Data Lakes and DataVisualization: An Innovative Approach to Address the Challenges of Access to Health Care in Mississippi. Online journal of public health informatics. 2015. doi:10.5210/ojphi.v7i3.6047
- XuHan, Anton Alyakin, Shannon Ciprut, Cathryn Lapierre, Jaden Stryker, John Golfinos, et al.. Neuro Data Hub: A New Approach for Streamlining Medical Clinical Research. Neurosurgery practice. 2025. doi:10.1227/neuprac.0000000000000162
- Jori Kern, Markus Katharina Brechtel, Tim Schumacher, Martin Lablans, Tobias Kussel.DataCastle: APragmatic Approach for Research and Real-World Data Management. Studies in health technology and informatics. 2026. doi:10.3233/SHTI260407
- Laura Antenucci, Chiara Iacomini,EdoardoPompei, Pierluigi Rogati, Gianluigi Buccomino, Stefano Patarnello, et al.. Transforming Hospital Data into Real-World Evidence for Clinical Research: Insights into a Scalable Framework at Fondazione Policlinico Gemelli Hospital. Studies in health technology and informatics. 2026. doi:10.3233/SHTI260446
- Frederic Ehrler, Florian Singer, Deniz Geçer, Julien Houeix, Emmanuel Durand.LeveragingLarge Language Models with Retrieval-Augmented Generation for Semantic Mapping of Clinical Data Lakes to SNOMED CT. Studies in health technology and informatics. 2026. doi:10.3233/SHTI260288
- Frederic Ehrler, Florian Singer, Deniz Geçer, Julien Houeix, Emmanuel Durand.QueryingHealthcare Data Lake Using LLMs Without Direct Data Exposure: A Feasibility Study. Studies in health technology and informatics. 2026. doi:10.3233/SHTI260287
- Hanna M Tolonen, Jouni Kaukovuori, Marja Airaksinen, Anna-Riia Holmström. Areelectronichealth record big data ready for secondary use in research? Exploring potential limitations with opioids as a case study. Health informatics journal. 2025. doi:10.1177/14604582251363501
