Breadcrumb

Eduki publikatzailea

Doktorego tesiaren defentsa: Advancing artificial intelligence for image-based regression through hybrid vision architectures: from facial age estimation to pulmonary severity assessment

Egilea: Gaby Maroun

Izenburua: Advancing artificial intelligence for image-based regression through hybrid vision architectures: from facial age estimation to pulmonary severity assessment

Zuzendaria: Fadi Dornaika

Eguna: 2026ko irailaren 25ean
Ordua: 10:30h
Lekua: Ada Lovelace aretoa (Infomatikako fakultatea)

Abstract:

"La Inteligencia Artificial (IA) y el aprendizaje profundo han transformado significativamente la visión por computador, permitiendo que los modelos evolucionen desde el reconocimiento de imágenes hacia tareas de predicción más complejas. Entre estas tareas, la regresión basada en imágenes resulta especialmente desafiante, ya que el valor objetivo no es directamente visible en la imagen, sino que debe inferirse a partir de evidencias visuales sutiles, distribuidas y, en muchos casos, ambiguas. Esta tesis doctoral aborda este problema mediante el diseño y la evaluación de arquitecturas visuales híbridas aplicadas a dos dominios complementarios: la estimación de edad facial a partir de imágenes de rostros y la evaluación de la gravedad de infecciones pulmonares a partir de imágenes médicas. Aunque estos dominios difieren en sus aplicaciones, características de los datos e implicaciones clínicas, comparten un desafío metodológico común: ambos requieren la predicción precisa de valores continuos o semicontinuos a partir de patrones visuales locales y de información contextual más amplia.

La estimación de edad facial sigue siendo un problema difícil, ya que el envejecimiento es un proceso no lineal, dependiente de cada individuo e influenciado por factores como la identidad, la genética, la etnicidad, el estilo de vida, la expresión facial, la pose, la iluminación y la calidad de la imagen. Las señales relacionadas con la edad pueden aparecer como detalles locales finos, tales como arrugas, textura de la piel y cambios perioculares, pero también como características faciales más globales, incluyendo proporciones y morfología del rostro. De manera similar, la evaluación de la gravedad pulmonar a partir de radiografías de tórax y tomografías computarizadas requiere que el modelo interprete anomalías radiológicas locales, al mismo tiempo que considera la distribución anatómica y la extensión general de la enfermedad. En ambos contextos, los modelos visuales puramente locales o puramente globales pueden resultar insuficientes. Las redes neuronales convolucionales son eficaces para extraer características visuales jerárquicas y localizadas, mientras que los modelos basados en transformadores proporcionan una capacidad más fuerte de razonamiento contextual mediante mecanismos de atención. Esta tesis investiga cómo estas fortalezas complementarias pueden combinarse y adaptarse para lograr una regresión robusta basada en imágenes.

La primera contribución de esta tesis introduce un marco híbrido ConvNeXt–Transformer para la estimación de edad facial. En este enfoque, ConvNeXt se utiliza como una arquitectura convolucional moderna para extraer representaciones faciales locales y discriminativas, mientras que un codificador Transformer refina estas representaciones mediante modelado contextual global antes de la etapa final de regresión de edad. Esta contribución demuestra que la combinación de la localidad convolucional y la atención basada en transformadores puede mejorar la estimación de edad facial al capturar tanto detalles finos sensibles a la edad como dependencias faciales de largo alcance.

La segunda contribución amplía este marco ConvNeXt–Transformer mediante un estudio experimental y analítico más completo. Más allá de reportar resultados estándar basados en el error absoluto medio, este trabajo analiza el comportamiento de las puntuaciones acumuladas, la eficiencia del modelo, la dinámica de entrenamiento, la visualización de la atención y los casos de fallo más difíciles. Este análisis proporciona una comprensión más completa de las fortalezas y limitaciones de la arquitectura híbrida propuesta, mostrando que los modelos de estimación de edad facial no deben evaluarse únicamente mediante el error promedio de predicción, sino también considerando su robustez, interpretabilidad, coste computacional y comportamiento frente a muestras complejas en condiciones no controladas.

La tercera contribución explora una estrategia diferente de modelado local-global mediante la adaptación del Global-Context Vision Transformer (GC-ViT) a la estimación de edad facial. A diferencia de los marcos híbridos ConvNeXt–Transformer anteriores, este enfoque se basa en una única arquitectura jerárquica de transformador que combina atención local por ventanas con modelado de contexto global. El marco propuesto se adapta a la regresión escalar de edad mediante una cabeza de regresión ligera, funciones de pérdida compuestas y una estrategia de reemplazo regional consciente de la edad, diseñada para regularizar el entrenamiento en condiciones de datos limitados. Esta contribución confirma que el razonamiento visual local-global sigue siendo valioso para la estimación de edad facial incluso sin una fusión explícita entre ramas convolucionales y transformadores.

La cuarta contribución transfiere la lógica arquitectónica general de la tesis a la regresión en imágenes médicas mediante HyS-Mamba, una red híbrida semántico-espacial basada en Mamba para la predicción de la gravedad de infecciones pulmonares a partir de imágenes de tórax. El modelo combina una rama espacial basada en ConvNeXt, una rama semántica basada en Vision Transformer, mecanismos de alineamiento contextual mediante compuertas y una fusión multiescala inspirada en Mamba para predecir objetivos de gravedad clínicamente significativos a partir de radiografías de tórax y tomografías computarizadas. Esta contribución muestra que el mismo principio desarrollado en la parte de análisis facial de la tesis —combinar evidencia local con razonamiento contextual global— puede adaptarse a un problema de regresión clínicamente más restringido, relacionado con puntuaciones radiológicas de gravedad y estimación del porcentaje de infección.

En conjunto, esta tesis contribuye al avance de la regresión basada en imágenes mediante IA, proponiendo arquitecturas visuales híbridas adaptadas a cada tarea, que combinan extracción convolucional de características, modelado contextual basado en transformadores, atención de contexto global y fusión inspirada en modelos de espacio de estados. Los estudios experimentales realizados sobre bases de datos de estimación de edad facial y conjuntos de imágenes médicas para la evaluación de gravedad pulmonar demuestran la relevancia del modelado visual híbrido para tareas de predicción continua. Al mismo tiempo, la tesis destaca desafíos abiertos importantes, incluyendo el sesgo en los datos, el cambio de dominio, la variabilidad demográfica, la eficiencia computacional, la interpretabilidad y la validación clínica. Estos resultados apoyan el desarrollo de sistemas de IA más precisos, robustos y conscientes del contexto para la predicción visual en escenarios reales, con aplicaciones que van desde el análisis facial hasta la imagen médica."