Doktorego tesiaren defentsa: Advancing artificial intelligence for image-based regression through hybrid vision architectures: from facial age estimation to pulmonary severity assessment
Lehenengo argitaratze data: 2026/09/17
Egilea: Gaby Maroun
Izenburua: Advancing artificial intelligence for image-based regression through hybrid vision architectures: from facial age estimation to pulmonary severity assessment
Zuzendaria: Fadi Dornaika
Eguna: 2026ko irailaren 25ean
Ordua: 10:30h
Lekua: Ada Lovelace aretoa (Infomatikako fakultatea)
Abstract:
"La Inteligencia Artificial (IA) y el aprendizaje profundo
han transformado significativamente la visión por computador,
permitiendo que los modelos evolucionen desde el reconocimiento de
imágenes hacia tareas de predicción más complejas. Entre estas
tareas, la regresión basada en imágenes resulta especialmente
desafiante, ya que el valor objetivo no es directamente visible en
la imagen, sino que debe inferirse a partir de evidencias visuales
sutiles, distribuidas y, en muchos casos, ambiguas. Esta tesis
doctoral aborda este problema mediante el diseño y la evaluación de
arquitecturas visuales híbridas aplicadas a dos dominios
complementarios: la estimación de edad facial a partir de imágenes
de rostros y la evaluación de la gravedad de infecciones pulmonares
a partir de imágenes médicas. Aunque estos dominios difieren en sus
aplicaciones, características de los datos e implicaciones clínicas,
comparten un desafío metodológico común: ambos requieren la
predicción precisa de valores continuos o semicontinuos a partir de
patrones visuales locales y de información contextual más amplia.
La estimación de edad facial sigue siendo un problema difícil,
ya que el envejecimiento es un proceso no lineal, dependiente de
cada individuo e influenciado por factores como la identidad, la
genética, la etnicidad, el estilo de vida, la expresión facial, la
pose, la iluminación y la calidad de la imagen. Las señales
relacionadas con la edad pueden aparecer como detalles locales
finos, tales como arrugas, textura de la piel y cambios
perioculares, pero también como características faciales más
globales, incluyendo proporciones y morfología del rostro. De manera
similar, la evaluación de la gravedad pulmonar a partir de
radiografías de tórax y tomografías computarizadas requiere que el
modelo interprete anomalías radiológicas locales, al mismo tiempo
que considera la distribución anatómica y la extensión general de la
enfermedad. En ambos contextos, los modelos visuales puramente
locales o puramente globales pueden resultar insuficientes. Las
redes neuronales convolucionales son eficaces para extraer
características visuales jerárquicas y localizadas, mientras que los
modelos basados en transformadores proporcionan una capacidad más
fuerte de razonamiento contextual mediante mecanismos de atención.
Esta tesis investiga cómo estas fortalezas complementarias pueden
combinarse y adaptarse para lograr una regresión robusta basada en imágenes.
La primera contribución de esta tesis introduce un marco
híbrido ConvNeXt–Transformer para la estimación de edad facial. En
este enfoque, ConvNeXt se utiliza como una arquitectura
convolucional moderna para extraer representaciones faciales locales
y discriminativas, mientras que un codificador Transformer refina
estas representaciones mediante modelado contextual global antes de
la etapa final de regresión de edad. Esta contribución demuestra que
la combinación de la localidad convolucional y la atención basada en
transformadores puede mejorar la estimación de edad facial al
capturar tanto detalles finos sensibles a la edad como dependencias
faciales de largo alcance.
La segunda contribución amplía este marco ConvNeXt–Transformer
mediante un estudio experimental y analítico más completo. Más allá
de reportar resultados estándar basados en el error absoluto medio,
este trabajo analiza el comportamiento de las puntuaciones
acumuladas, la eficiencia del modelo, la dinámica de entrenamiento,
la visualización de la atención y los casos de fallo más difíciles.
Este análisis proporciona una comprensión más completa de las
fortalezas y limitaciones de la arquitectura híbrida propuesta,
mostrando que los modelos de estimación de edad facial no deben
evaluarse únicamente mediante el error promedio de predicción, sino
también considerando su robustez, interpretabilidad, coste
computacional y comportamiento frente a muestras complejas en
condiciones no controladas.
La tercera contribución explora una estrategia diferente de
modelado local-global mediante la adaptación del Global-Context
Vision Transformer (GC-ViT) a la estimación de edad facial. A
diferencia de los marcos híbridos ConvNeXt–Transformer anteriores,
este enfoque se basa en una única arquitectura jerárquica de
transformador que combina atención local por ventanas con modelado
de contexto global. El marco propuesto se adapta a la regresión
escalar de edad mediante una cabeza de regresión ligera, funciones
de pérdida compuestas y una estrategia de reemplazo regional
consciente de la edad, diseñada para regularizar el entrenamiento en
condiciones de datos limitados. Esta contribución confirma que el
razonamiento visual local-global sigue siendo valioso para la
estimación de edad facial incluso sin una fusión explícita entre
ramas convolucionales y transformadores.
La cuarta contribución transfiere la lógica arquitectónica
general de la tesis a la regresión en imágenes médicas mediante
HyS-Mamba, una red híbrida semántico-espacial basada en Mamba para
la predicción de la gravedad de infecciones pulmonares a partir de
imágenes de tórax. El modelo combina una rama espacial basada en
ConvNeXt, una rama semántica basada en Vision Transformer,
mecanismos de alineamiento contextual mediante compuertas y una
fusión multiescala inspirada en Mamba para predecir objetivos de
gravedad clínicamente significativos a partir de radiografías de
tórax y tomografías computarizadas. Esta contribución muestra que el
mismo principio desarrollado en la parte de análisis facial de la
tesis —combinar evidencia local con razonamiento contextual global—
puede adaptarse a un problema de regresión clínicamente más
restringido, relacionado con puntuaciones radiológicas de gravedad y
estimación del porcentaje de infección.
En conjunto, esta tesis contribuye al avance de la regresión
basada en imágenes mediante IA, proponiendo arquitecturas visuales
híbridas adaptadas a cada tarea, que combinan extracción
convolucional de características, modelado contextual basado en
transformadores, atención de contexto global y fusión inspirada en
modelos de espacio de estados. Los estudios experimentales
realizados sobre bases de datos de estimación de edad facial y
conjuntos de imágenes médicas para la evaluación de gravedad
pulmonar demuestran la relevancia del modelado visual híbrido para
tareas de predicción continua. Al mismo tiempo, la tesis destaca
desafíos abiertos importantes, incluyendo el sesgo en los datos, el
cambio de dominio, la variabilidad demográfica, la eficiencia
computacional, la interpretabilidad y la validación clínica. Estos
resultados apoyan el desarrollo de sistemas de IA más precisos,
robustos y conscientes del contexto para la predicción visual en
escenarios reales, con aplicaciones que van desde el análisis facial
hasta la imagen médica."