Registro:
| Documento: | Tesis de Grado |
| Título: | Aplicación de embeddings de BERT para detección automática de Alzheimer |
| Título alternativo: | Application of BERT embeddings for Alzheimer’s automatic detection |
| Autor: | Goldberg, Sofía Milena |
| Editor: | Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales |
| Fecha de defensa: | 2025-05-19 |
| Fecha en portada: | 2025 |
| Grado Obtenido: | Grado |
| Título Obtenido: | Licenciado en Ciencias de la Computación |
| Departamento Docente: | Departamento de Computación |
| Director: | Brusco, Pablo Daniel |
| Director Asistente: | Gauder, María Lara |
| Jurado: | Juantorena, Gustavo; Cotik, Viviana Erica |
| Idioma: | Español |
| Palabras clave: | ALZHEIMER; EMBEDDINGS; BERT; CLASIFICACION; ANALISIS CRUZADO ENTRE LENGUAJESALZHEIMER; EMBEDDINGS; BERT; CLASSIFICATION; CROSS-LINGUAL ANALYSIS |
| Formato: | PDF |
| Handle: |
https://hdl.handle.net/20.500.12110/seminario_nCOM000855_Goldberg |
| PDF: | https://bibliotecadigital.exactas.uba.ar/download/seminario/seminario_nCOM000855_Goldberg.pdf |
| Registro: | https://bibliotecadigital.exactas.uba.ar/collection/seminario/document/seminario_nCOM000855_Goldberg |
| Ubicación: | COM 000855 |
| Derechos de Acceso: | Esta obra puede ser leída, grabada y utilizada con fines de estudio, investigación y docencia. Es necesario el reconocimiento de autoría mediante la cita correspondiente. Goldberg, Sofía Milena. (2025). Aplicación de embeddings de BERT para detección automática de Alzheimer. (Tesis de Grado. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales.). Recuperado de https://hdl.handle.net/20.500.12110/seminario_nCOM000855_Goldberg |
Resumen:
La detección temprana del Alzheimer representa un desafío clave en el ámbito médico, ya que un diagnóstico preciso en las primeras etapas de la enfermedad puede facilitar intervenciones más efectivas y mejorar la calidad de vida de los pacientes. En este contexto, el análisis del habla y el lenguaje ha surgido como una herramienta prometedora para identificar patrones lingüísticos asociados con el deterioro cognitivo. En este estudio, investigamos la efectividad de los embeddings generados con BERT para la clasificación de transcripciones de habla, con el propósito de distinguir entre individuos con Alzheimer y controles sanos, en inglés y en español. Además de replicar un trabajo previo, ampliamos el análisis comparando el desempeño de distintas representaciones de los textos, agregando métricas de evaluación y observando el impacto de utilizar modelos entrenados con texto capitalizado (cased) y modelos entrenados únicamente con texto en minúsculas (uncased). Tanto en inglés como en español, nuestros resultados superaron a los reportados en el trabajo replicado. En inglés, el mejor F1-score obtenido fue de 0,76 con Random Forest, superando el 0,69 reportado en el trabajo original con XGBoost. En español, SVM alcanzó un F1-score de 0,70, mejorando significativamente el 0,53 reportado. Nuestros experimentos revelaron que el F1-score no es una métrica adecuada para evaluar el desempeño de los clasificadores, especialmente en conjuntos de datos desbalanceados. Por ello, analizamos métricas adicionales como precision, recall, accuracy, specificity, ROC AUC y PR AUC, que permitieron una evaluación más detallada del rendimiento de los clasificadores. Los hallazgos obtenidos evidencian que las representaciones contextuales derivadas de la última capa de BERT superan a los embeddings extraídos de la primera capa, gracias a su capacidad de capturar información semántica más rica y dependiente del contexto. En el Pitt Corpus (inglés), los embeddings de la última capa lograron un ROC AUC de hasta 0,89, mientras que los embeddings de la primera capa alcanzaron un máximo de 0,84. En Chile AD (español), aunque el rendimiento general fue inferior, los embeddings de la última capa de BERT obtuvieron un ROC AUC de 0,72, superando ampliamente a los embeddings provenientes de la primera capa, cuyo mejor desempeño fue 0,54. Asimismo, observamos que en español, los modelos cased mejoran el rendimiento de los clasificadores, mientras que en inglés, los modelos uncased resultan más eficaces. En el Pitt Corpus, SVM con embeddings de la última capa logró un ROC AUC de 0,90 con el modelo uncased, mientras que con el modelo cased obtuvo 0,87. En contraste, en Chile AD, el uso de la versión uncased redujo significativamente el desempeño, con una caída en ROC AUC de 0,72 a 0,41 en Random Forest con los embeddings de la primera capa. Nuestros resultados indican que, en general, el desempeño en inglés fue superior al obtenido en español, lo que podría atribuirse a la menor cantidad de datos disponibles, el desbalance entre las clases en el conjunto en español o a las diferencias entre los modelos de BERT empleados en cada idioma.
Abstract:
Early detection of Alzheimer’s disease is a key challenge in the medical field, as an accurate diagnosis in the early stages of the disease can enable more effective interventions and improve patients’ quality of life. In this context, speech and language analysis has emerged as a promising tool for identifying linguistic patterns associated with cognitive decline. In this study, we investigate the effectiveness of BERT-generated embeddings for classifying speech transcriptions to distinguish between individuals with Alzheimer’s and healthy controls in both English and Spanish. In addition to replicating a previous study, we extend the analysis by comparing the performance of different text representations, incorporating additional evaluation metrics, and examining the impact of using models trained on capitalized text (cased) versus models trained exclusively on lowercase text (uncased). In both English and Spanish, our results outperformed those reported in the replicate study. In English, the best F1-score obtained was 0,76 with Random Forest, surpassing the 0,69 reported in the original study with XGBoost. In Spanish, SVM achieved an F1-score of 0,70, significantly improving upon the 0,53 reported. Our experiments revealed that the F1-score is not an adequate metric to fully evaluate classifier performance, especially in imbalanced datasets. Therefore, we analyzed additional metrics such as precision, recall, accuracy, specificity, ROC AUC, and PR AUC, which provided a more detailed assessment of classifier performance. The findings show that contextual representations derived from BERT’s last layer out-perform embeddings extracted from the first layer, thanks to their ability to capture richer, context-dependent semantic information. In the Pitt Corpus (English), last-layer embeddings achieved a ROC AUC of 0,89, whereas first-layer embeddings reached a maximum of 0,84. In Chile AD (Spanish), although overall performance was lower, last-layer BERT embeddings obtained a ROC AUC of 0,72, significantly surpassing the 0,54 achieved with first-layer embeddings. Furthermore, we observed that in Spanish, cased models improve classifier performance, whereas in English, uncased models are more effective. In the Pitt Corpus, SVM with last-layer embeddings achieved a ROC AUC of 0,90 with the uncased model, while the cased model yielded 0,87. In contrast, in Chile AD, using the uncased version significantly reduced performance, with a drop in ROC AUC from 0,72 to 0,41 in Random Forest with first-layer embeddings. Our results indicate that, overall, performance in English was superior to that in Spanish. This could be attributed to the smaller amount of available data, the class imbalance in the Spanish dataset, or differences between the BERT models used for each language.
Citación:
---------- APA ----------
Goldberg, Sofía Milena. (2025). Aplicación de embeddings de BERT para detección automática de Alzheimer. (Tesis de Grado. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales.). Recuperado de https://hdl.handle.net/20.500.12110/seminario_nCOM000855_Goldberg
---------- CHICAGO ----------
Goldberg, Sofía Milena. "Aplicación de embeddings de BERT para detección automática de Alzheimer". Tesis de Grado, Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales, 2025.https://hdl.handle.net/20.500.12110/seminario_nCOM000855_Goldberg
Estadísticas:
Descargas mensuales
Total de descargas desde :
https://bibliotecadigital.exactas.uba.ar/download/seminario/seminario_nCOM000855_Goldberg.pdf
Distrubución geográfica