Este reto busca el desarrollo de soluciones que permitan mejorar la calidad y representatividad de los datos clínicos utilizados para entrenar y validar modelos de Inteligencia Artificial aplicados al ámbito sanitario.
Reto planteado en el proyecto AI-BOOST a través del AI Challenge Competition.
Descripción del reto
Los datos de imagen médica utilizados para desarrollar modelos de Inteligencia Artificial proceden cada vez más de bases de datos clínicas y datos de práctica real. Sin embargo, estos conjuntos de datos pueden presentar problemas de calidad, completitud, consistencia y representación de determinados grupos de pacientes, lo que puede limitar la capacidad de los modelos para generalizar correctamente.
Este reto busca abordar estas limitaciones mediante el desarrollo de un modelo de IA Generativa capaz de crear cohortes sintéticas a partir de los datos clínicos existentes, mejorando la representación de grupos infrarrepresentados y completando información clínica o de imagen que pueda estar ausente.
La solución deberá identificar las principales características demográficas, clínicas y de imagen relevantes para la generación de las cohortes y utilizar esta información para aumentar los conjuntos de datos existentes.
Además, se deberá evaluar la calidad, realismo y consistencia de los datos generados respecto a los datos originales, así como su capacidad para reducir sesgos y desequilibrios entre diferentes subgrupos de población. El reto contempla también la completitud de datos clínicos, la generación de adquisiciones de imagen CT ausentes y la armonización de estudios de imagen obtenidos con diferentes protocolos de adquisición.
Objetivos del reto
Las soluciones deberán ser capaces de:
- Demostrar cómo la utilización de datos sintéticos contribuye a reducir sesgos y mejorar la calidad de los modelos de Inteligencia Artificial aplicados al ámbito sanitario.s propuestas deberán abordar, entre otros, los siguientes objetivos:
- Desarrollar un modelo de IA Generativa para crear cohortes sintéticas a partir de los datos proporcionados.
- Identificar las variables demográficas, clínicas y de imagen más relevantes para la generación de los nuevos datos.
- Ampliar los conjuntos de datos existentes mejorando el equilibrio entre los diferentes grupos de pacientes.
- Evaluar la calidad, el realismo y la consistencia de los datos sintéticos generados.
Resultado esperado
El reto persigue el desarrollo de un prototipo con un nivel de madurez tecnológica TRL 7, capaz de generar cohortes sintéticas que complementen los conjuntos de datos existentes y puedan utilizarse para el entrenamiento y validación de modelos de Inteligencia Artificial en imagen médica. La solución podrá integrarse posteriormente en la infraestructura europea EUCAIM, favoreciendo su reutilización en futuras aplicaciones de investigación e innovación.
Indicadores de evaluación
Las propuestas serán evaluadas, entre otros aspectos, en función de:
- Fidelidad de los datos sintéticos respecto a los datos originales.
- Reducción de los sesgos y mejora del equilibrio entre cohortes de pacientes.
- Capacidad para completar información clínica e imágenes médicas ausentes.
- Armonización de estudios de tomografía computarizada obtenidos bajo diferentes condiciones de adquisición.
- Robustez y estabilidad de los datos generados para el entrenamiento de modelos de Inteligencia Artificial.
Infraestructura disponible
Los participantes trabajarán sobre un conjunto de datos anonimizados compuesto por 1.088 estudios de tomografía computarizada (TC) de tórax, acompañados de información clínica relevante. El desarrollo se realizará en un entorno seguro proporcionado por la infraestructura europea EUCAIM y CINECA, que permitirá el tratamiento de datos clínicos sensibles sin comprometer su privacidad y garantizando el cumplimiento de la normativa aplicable.
Plazo
Del 3 de julio al 8 de septiembre
Más información sobre el reto
Más información sobre la convocatoria
