El Big Data (datos masivos) ha aparecido en nuestras vidas para quedarse. Con la evolución de la tecnología digital, somos capaces de generar una gran cantidad de información cada día. Por ejemplo, cuando realizas una tarea tan cotidiana y que tanto nos gusta como utilizar la búsqueda de Google, ¿te has parado a pensar que con ese simple gesto estás generando datos que forman un enorme conjunto de información? Realizamos millones de búsquedas en Google. Estos datos forman parte del Big Data y se utilizan para personalizar tu experiencia en línea.
El Big Data está siendo trending topic en nuestra sociedad y está transformando la forma en qué vivimos y trabajamos. Pero, ¿este fenómeno es tan reciente cómo pensamos? ¿Cuáles son sus orígenes y evolución hasta el día de hoy? Y la gran pregunta es, ¿estamos ante una nueva revolución industrial impulsada por los datos?
En este artículo, nos sumergiremos en la historia del Big Data, su aplicación en el sector salud, beneficios y desafíos que plantea en el futuro.
De las tablillas de arcilla a los big data: la evolución del análisis de datos.

Los orígenes del Big Data se remontan a tiempos muy antiguos. Civilizaciones como la babilonia y la egipcia crearon las primeras bibliotecas y registraban información para tomar decisiones. Sin embargo, es con el avance de la ciencia y la tecnología que el análisis de datos se consolida como una disciplina.
Avances importantes en la historia del Big Data:
- Siglo XVII: John Graunt realizó el primer experimento conocido de análisis de datos. Estudió cómo se propagaría la peste bubónica en la ciudad.
- Siglo XIX: Surge el concepto de Business Intelligent y se comienza a utilizar la información para mejorar las operaciones comerciales.
- Siglo XX: Con la aparición de las computadoras, se empiezan a almacenar grandes volúmenes de datos, pero el término de Big Data aún no es popular.
- Finales del siglo XX: El periodista Erik Larson habla por primera vez con el término Big Data en un artículo de marketing publicado en Harpers Magazine.
- Siglo XXI: Junto al gran crecimiento de Internet de las Cosas (IoT) y la creación de plataformas Open Source como Hadoop, el Big Data se populariza y se convierte en una tecnología fundamental para las empresas.
¿Qué es el Big Data?
El Big Data o datos masivos se refiere al conjunto de datos muy grandes y complejos que necesitan de aplicaciones informáticas no habituales para el procesamiento de estos datos y así tratarlos de forma adecuada. Por ejemplo, las fotos y videos, mensajes y comentarios en Facebook generan varios cientos de terabytes de datos nuevos cada día. Si sumamos todos los datos que se generan en el mundo, se estima que en 2025 se superará el total de 181 zettabytes (equivalen a 181 mil millones de gigabytes).

Las 5 Vs del Big Data: un universo de datos en constante expansión.
Las características principales del Big Data son:
- Volumen: esta característica es la más obvia, porque el Big Data se caracteriza por su inmenso tamaño. La gran cantidad de datos que se generan cada día en Internet, con las redes sociales, sensores IoT, transacciones, entre otros, está contribuyendo a que el volumen de datos generados crezca exponencialmente.
- Velocidad: el Big Data necesita una velocidad muy alta para generar, almacenar y procesar la información. Para poder trabajar en tiempo real con las fuentes generadoras de datos, como pueden ser cámaras de videos, un directo en redes sociales, un blog, etcétera.
- Variedad: los datos se pueden registrar de diferentes formas. Puede tratarse de datos estructurados y no estructurados. Los estructurados son fáciles de procesar, como por ejemplo las bases de datos. Los no estructurados son más complejos y pueden venir de audios, videos o imágenes que generamos desde los dispositivos móviles, también de publicaciones en redes sociales o de artículos de blog.
- Veracidad: el objetivo principal es obtener datos fiables para poder mejorar nuestras decisiones. Datos erróneos o incompletos pueden llevar a conclusiones equivocadas y decisiones costosas.
- Valorización: el valor del Big Data reside en su capacidad para generar conocimiento y transformar los negocios. Al realizar análisis con grandes volúmenes de datos, las empresas pueden extraer patrones, tendencias y oportunidades de negocio que de otra manera serían invisibles.
Los datos: el nuevo motor de la innovación en salud.

El sector comercial y financiero han sido los primeros en impulsar el Big Data, aplicándolo en la industria para obtener beneficios. Pero, ¿qué pasaría si utilizáramos esta tecnología en la salud? Imaginemos un futuro donde el diagnóstico y tratamiento sean totalmente personalizados, basados en análisis de grandes volúmenes de datos.
El Big Data en salud ofrece una oportunidad única para mejorar la atención médica, identificar patrones de enfermedades, desarrollar nuevos tratamientos y optimizar la gestión de recursos. Sin embargo, es fundamental garantizar la calidad y privacidad de los datos para asegurar una atención médica segura y eficaz.
Fuente de información en salud:
Se nutre de una amplia variedad de fuentes, desde registros médicos electrónicos hasta datos generados por dispositivos móviles y redes sociales. Gracias a esta riqueza de información podemos construir modelos predictivos más precisos, identificar brotes pandémicos de manera temprana y desarrollar nuevas terapias.
Las fuentes de datos en salud pueden clasificarse en:
- Datos clínicos: registros médicos electrónicos, imágenes médicas, historial de tratamientos.
- Datos generados por dispositivos: datos de sensores, wearables, dispositivos médicos.
- Datos externos: redes sociales, búsquedas en Internet, datos demográficos.
Los 3 pilares del análisis del Big Data: descubre, predice y decide.
Os presento los 3 tipos de análisis más utilizados en Big Data:
Análisis descriptivo: ¿Qué ha sucedido? Este tipo de análisis es ideal para echar una mirada al pasado y comprender mejor el presente. A consecuencia, podemos identificar patrones, tendencias y relaciones entre los datos. Por ejemplo, podemos segmentar a nuestros clientes en grupos con características similares para adaptar nuestras estrategias de marketing.
Análisis predictivo: ¿Qué sucederá? Nos ayuda a anticipar el futuro. Usando modelos estadísticos y de machine learning, se pueden predecir comportamientos futuros, como la probabilidad de que un cliente compre un producto o de que un equipo falle. Este tipo de análisis es importante cuando se toman decisiones estratégicas y se quieren prevenir riesgos.
Análisis prescriptivo: ¿Qué debemos hacer? Aquí damos un paso más allá y este análisis nos indica qué acciones debemos tomar para alcanzar nuestros objetivos. Si combinamos los resultados de los dos análisis anteriores, podemos identificar mejores opciones y optimizar nuestras decisiones. Por ejemplo, podemos determinar la mejor ruta de distribución de un producto.
El científico de datos: un perfil en alta demanda.
Para aplicar el Big Data se necesitan nuevos perfiles profesionales llamados data scientists o científicos de datos.
Son perfiles muy especializados que requieren un amplio conjunto de habilidades, que incluyen programación (Python, R), estadística, conocimiento del sector, resolución de problemas y visualización de datos. Aunque encontrar un perfil tan completo puede ser un desafío, la creciente oferta de formación especializada está permitiendo a profesionales de diferentes áreas adquirir las competencias necesarias para desempeñar este rol. La demanda de científicos de datos continuará creciendo en los próximos años, impulsando la transformación digital de las organizaciones.

Son tantas las habilidades diferentes que ha de reunir un científico de datos que buscar uno sería como buscar un unicornio: una criatura mítica con habilidades extraordinarias. La verdad es que a mí me gustaría convertirme en un unicornio, pero uno azul, no rosa. En breve, empezaré a estudiar un Máster Experto en Data Science, Big Data e IA. ¿Quién más se anima a formarse en este campo?
¿Cómo son los proyectos Big Data?
Para la primera fase, se inicia con una fase exploratoria, caracterizada por un pensamiento crítico y la formulación de preguntas relevantes para el negocio o investigación. Estas preguntas guiarán la búsqueda y el análisis de datos. Además, un buen análisis puede generar nuevas hipótesis a desarrollar en un futuro.
En la segunda fase, se define una estrategia clara y se establecen objetivos alineados con los generales de la organización. Es fundamental contar con una comprensión profunda del problema a resolver y de los recursos disponibles.
Una vez establecida la estrategia, se procede a la selección y aplicación de las herramientas tecnológicas más adecuadas para el proyecto. Entre las tecnologías más comunes se encuentran Hadoop, Spark y diversas herramientas de visualización. El proceso de análisis de datos suele incluir las siguientes etapas: obtención y almacenamiento de datos desde diversas fuentes, limpieza y transformación de los datos para garantizar su calidad, aplicación de técnicas de análisis para extraer insights y visualización de los resultados de manera clara y concisa.
El Data Lake Sanitario y la importancia de la interoperabilidad en salud.
La interoperabilidad, es decir, la capacidad de diferentes sistemas para intercambiar y utilizar información de manera conjunta, es esencial para el desarrollo del Big Data en salud. En España, se está trabajando en la creación del Data Lake Sanitario, un repositorio centralizado que almacenará los datos de salud de todas las comunidades autónomas. Este proyecto permitirá aplicar técnicas de inteligencia artificial y análisis de datos a gran escala para mejorar la atención al paciente, identificar patrones de enfermedad y desarrollar nuevas terapias. Gracias a la interoperabilidad, los profesionales sanitarios tendrán acceso a una visión más completa y actualizada de la salud de los pacientes, lo que permitirá tomar decisiones más informadas y personalizadas.
Aplicaciones del Big Data en el sector sanitario.
Actualmente, se está desarrollando el Big Data en múltiples ámbitos en salud. Aún cuando la historia clínica electrónica (historial de paciente en formato electrónico) y el resto del registro de salud son la base necesaria para la ordenación de datos, no es suficiente para sacarles todo el provecho. También es necesario aplicar el Big Data para conseguir el beneficio del conocimiento obtenido a través de una aplicación de análisis de datos más en profundidad.
¿Qué campos se pueden beneficiar de la aplicación de las técnicas del Big Data?
- Genómica.
Es un gran campo de aplicación del Big Data directamente relacionado con la bioinformática. El objetivo es recoger, almacenar, procesar e interpretar la información biológica codificada en el genoma humano. Así, gracias a poderosos sistemas de análisis y una estandarización de procesos de secuenciación, somos capaces de conseguir mejores resultados en la investigación y secuenciación del genoma. Puede suponer toda una revolución gracias a los avances de esta técnica y su reducción de costes.
¿En qué puede beneficiarnos? Se podría predecir con más exactitud si una persona tendría tendencia o no a desarrollar una patología en función de sus factores genéticos; así nos podríamos adelantar al desarrollo de esta. Iríamos en la dirección de la medicina preventiva. A través de la fármaco-genética se podrían elegir medicaciones personalizadas y más útiles para los pacientes.
- Investigación clínica.
Aplicando el Big Data en este caso, se consigue de forma más rápida y con más precisión determinar las causas de las enfermedades y conseguir mejores soluciones. Aumenta la calidad de la documentación científica, entre otros beneficios.
- Epidemiología.
Otro campo importante donde el Big Data puede marcar la diferencia es en el estudio de las epidemias y cómo es mejor combatirlas. Es muy útil para predecir la propagación de algún virus y, gracias a la geolocalización de los móviles, saber por dónde se está propagando. De esta forma, se pueden preparar vacunas y disponer de centros de atención en las zonas más afectadas o saber dónde imponer restricciones de movimiento si fuera realmente necesario.
- Monitorización de enfermos crónicos.
Gracias a la innovación tecnológica, hoy día es posible capturar y generar señales biométricas de pacientes con enfermedades crónicas desde su casa sin necesidad de ir al hospital o permanecer ingresado en él. De este modo, profesionales de la salud a distancia pueden hacer seguimiento de la enfermedad y personalizar el tratamiento.
- Operativa clínica.
Se centra en la gestión de hospitales o centros médicos, optimización de la gestión de pacientes, reducción de gastos, asignación adecuada de recursos, disminuir el tiempo de espera de los pacientes, etcétera.
- Farmacología.
En este ámbito, el Big Data es capaz de complementar la información obtenida en los ensayos clínicos aleatorizados con pacientes, añadiendo datos del mundo real, consiguiendo mejorar la eficacia de un determinado principio activo de un medicamento. Con este sistema, desciende el coste del desarrollo médico, abriendo las puertas a nuevos modelos de negocios en el sector farmacéutico. Y si esto ocurriera, se podría conseguir un tratamiento con menor coste para las llamadas enfermedades raras y, de este modo, podríamos alcanzar una mejora de salud en más personas de la población.
Casos de éxito del Big Data en salud en España: SMUFIN y SAVANA
España se posiciona a la vanguardia de la aplicación del Big Data en el sector salud. Proyectos como SMUFIN y SAVANA demuestran el potencial de esta tecnología para transformar la investigación médica y la atención al paciente. SMUFIN, desarrollado por el BSC-CNS, ha revolucionado el análisis genómico de tumores, mientras que SAVANA ofrece soluciones innovadoras para extraer valor de las historias clínicas electrónicas. Estos ejemplos ilustran cómo el Big Data puede mejorar el diagnóstico, personalizar los tratamientos y optimizar la gestión de los sistemas sanitarios.
SMUFIN (Somatic Mutations Finder)
La revista Nature Biotechnology ha publicado un artículo científico sobre SMUFIN (Somatic Mutations Finder). Es un nuevo sistema que utiliza el Big Data para analizar el genoma completo de un tumor y localizar sus mutaciones en pocas horas. También consigue detectar alteraciones que quedaban ocultas incluso con otros métodos donde se utilizaban supercomputadores durante semanas.
Este gran trabajo de investigación lo ha desarrollado el grupo de genómica computacional del Barcelona Supercomputing Centre-Centro Nacional de Supercomputación (BSC-CNS), liderado por el Dr. David Torrents, en colaboración con el equipo del Dr. Elías Campo, jefe del grupo IDIBAPS Oncomorfología funcional humana y experimental y director de investigación del Clínic. También han participado el Instituto de Oncología de la Universidad de Oviedo (IUOPA), la European Molecular Biology Laboratory (EMBL, Heidelberg) y el Centro Nacional de Análisis Genómico (CNAG).
Si queréis ampliar información sobre este tema os dejo el enlace: Un nuevo método computacional permite analizar los cambios genéticos de pacientes con cáncer en pocas horas | Hospital Clínic Barcelona (clinicbarcelona.org)
SAVANA
Es una empresa que desarrolla plataformas y soluciones basadas en algoritmos de inteligencia artificial para ayudar a hospitales y organizaciones sanitarias en investigación y en su estrategia de datos. Son capaces de analizar, resumir y presentar en formato sencillo la información médica contenida en el conjunto de historias clínicas electrónicas para su utilización en la práctica clínica en tiempo real.
Si queréis curiosear os dejo el enlace a su página web:

Comparación entre ambos proyectos.
Las similitudes entre ambos proyectos son varias:
Ambos proyectos aprovechan el potencial del Big Data para conseguir información valiosa de grandes conjuntos de datos en el ámbito de la salud.
Tanto SMUFIN como SAVANA tienen el objetivo de impulsar la innovación en el sector sanitario a través de la aplicación de tecnologías avanzadas. Y su objetivo final es mejorar la atención al paciente, a través de diagnósticos más precisos (SMUFIN) o de una mejor comprensión de las historias clínicas (SAVANA).
Las diferencias se pueden observar en la tabla siguiente:
Desafíos y oportunidades del Big Data en salud: barreras y riesgos a superar.
Barreras tecnológicas: la interoperabilidad entre sistemas sanitarios es fundamental para el éxito del Big Data en salud. Sin embargo, la falta de estándares comunes y la heterogeneidad de los datos dificultan la integración de información proveniente de diferentes fuentes. Además, la calidad de los datos recogidos puede ser variable, lo que limita su utilidad para análisis avanzados.
Barreras legales y éticas: la protección de datos personales en el ámbito sanitario es una prioridad. La normativa vigente debe evolucionar para garantizar la seguridad y confidencialidad de la información, al tiempo que permite la investigación y la innovación. Asimismo, es necesario abordar los desafíos éticos asociados al uso de datos personales, como el consentimiento informado y la equidad en el acceso a las tecnologías de la información.
Barreras de recursos humanos: la escasez de profesionales especializados en Big Data en el ámbito de la salud es un obstáculo significativo. Se requiere una formación específica para desarrollar las habilidades necesarias para analizar grandes volúmenes de datos complejos y extraer conocimientos relevantes para la toma de decisiones clínicas.
El futuro de la salud a través del cristal del Big Data: Tendencias y desafíos.
El Big Data está revolucionando la medicina, personalizando tratamientos y optimizando recursos. Pero, ¿qué nos esperará en un futuro?
Hablar sobre el futuro de esta nueva tecnología es tan dinámico que lo que es vanguardia hoy mañana puede ser estándar, porque en la actualidad es una tecnología tan joven que aún no está totalmente desarrollada.
Nos vamos encaminando hacia una medicina más moderna y, sobretodo, más personalizada. Los avances tecnológicos en las TIC y en el campo de la genética, junto a nuevas tendencias en bienestar y salud, provocarán el diseño individualizado de estrategias terapéuticas para cada paciente.
La aplicación del Big Data en Salud provocará una mejora en los procesos de práctica clínica e investigación médica; se realizarán sus procedimientos de forma más rápida, reduciendo los costes y, de esta forma, podrán llegar a más pacientes; incluso pacientes con “enfermedades raras” podrán disfrutar de medicación personalizada.
Podría haber una clara tendencia de que vayamos hacia los datos globales, es decir, se podría estandarizar la comunicación entre sistemas, para que se puedan comunicar entre países de todo el mundo.

Quizás se podría potenciar la realidad virtual; al igual que se está desarrollando para el mundo de los videojuegos, tendría su buena utilidad en el mundo médico. Por ejemplo, para formarse o entrenarse antes de una operación, pudiendo ver el cuerpo del paciente en 3D. También se podría utilizar para tratar trastornos de fobias, estrés postraumático o adicciones.
El desarrollo de la tecnología 5G podría implicar una mejora en la utilización de dispositivos tecnológicos que se utilizan para el control y seguimiento de patologías crónicas. Se complementan con aplicaciones en móviles que sirven para compartir la información obtenida de las mediciones de los sensores (datos del paciente).
Las herramientas de visualización están muy unidas a los modelos matemáticos y estadísticos que se vienen utilizando hasta ahora. ¿Por qué no desarrollar nuevas formas de visualización de datos más naturales al ser humano? Para poder comunicar la información de los datos de forma como si estuvieras contando una historia, por ejemplo.
El machine learning está obteniendo cada vez mejores resultados y cada vez está siendo más famoso porque los resultados están siendo sorprendentes. El machine learning es una forma de análisis de datos donde el proceso de modelización analítico está automatizado a través de algoritmos. A través de estos algoritmos se van encontrando patrones ocultos en los datos. Cada vez se están volviendo más eficientes y rápidos, gracias al avance en la tecnología.
Referencias bibliográficas.
Informe Big Data en Salud Digital.pdf (ontsi.es)
https://espanadigital.gob.es/lineas de actuación/data-lake-sanitario
https://www.lamoncloa.gob.es/serviciosdeprensa/notasprensa/transformacion-digital-y-funcion-publica/Paginas/2024/140624-presupuesto-chttps://espanadigital.gob.es/lineas-de-actuacion/data-lake-sanitariocaa-espacio-datos-salud.aspx
Imágenes y gráficos.