Registro:
| Documento: | Tesis de Grado |
| Título: | Estudio de la homología de proteínas mediante embeddings basados en repeticiones maximales de sus secuencias |
| Título alternativo: | Study of protein homology using embeddings based on maximal repeats of their sequences |
| Autor: | Giordano, Mauro |
| Editor: | Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales |
| Publicación en la web: | 2026-07-08 |
| Fecha de defensa: | 2025-12-02 |
| Fecha en portada: | 2025 |
| Grado Obtenido: | Grado |
| Título Obtenido: | Licenciado en Ciencias de la Computación |
| Departamento Docente: | Departamento de Computación |
| Director: | Turjanski, Pablo Guillermo |
| Director Asistente: | Ferreiro, Diego Ulises |
| Jurado: | Espada, Rocío; Lanzarotti, Esteban Omar |
| Idioma: | Español |
| Palabras clave: | PROTEINAS; HOMOLOGIA; SECUENCIA; REPETICIONES MAXIMALES; BIGQUERY; EMBEDDINGS; FASTTEXT; SKIP-GRAM; T-SNE; CLUSTERS; CLASIFICACION; APRENDIZAJE NO SUPERVISADOPROTEINS; HOMOLOGY; SEQUENCE; MAXIMAL REPEATS; BIGQUERY; EMBEDDINGS; FAST-TEXT; SKIP-GRAM; T-SNE; CLUSTERS; CLASSIFICATION; UNSUPERVISED LEARNING |
| Formato: | PDF |
| Handle: |
https://hdl.handle.net/20.500.12110/seminario_nCOM000892_Giordano |
| PDF: | https://bibliotecadigital.exactas.uba.ar/download/seminario/seminario_nCOM000892_Giordano.pdf |
| Registro: | https://bibliotecadigital.exactas.uba.ar/collection/seminario/document/seminario_nCOM000892_Giordano |
| Ubicación: | COM 000892 |
| Derechos de Acceso: | Esta obra puede ser leída, grabada y utilizada con fines de estudio, investigación y docencia. Es necesario el reconocimiento de autoría mediante la cita correspondiente. Giordano, Mauro. (2025). Estudio de la homología de proteínas mediante embeddings basados en repeticiones maximales de sus secuencias. (Tesis de Grado. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales.). Recuperado de https://hdl.handle.net/20.500.12110/seminario_nCOM000892_Giordano |
Resumen:
El estudio de homología de proteínas y su clasificación en familias son pilares de la biología molecular; sin embargo, los métodos tradicionales suelen ser costosos, lentos y dependientes de heurísticas con múltiples parámetros ajustables. Este trabajo introduce una estrategia no supervisada para abordar este desafío, buscando representar el espacio de secuencias de proteínas de una forma que permita medir distancias con significado biológico. El método formulado se basa en la construcción de embeddings a partir de definir un “vocabulario biológico” basado en las repeticiones maximales (MRs) de aminoácidos presentes en un corpus de secuencias. El pipeline desarrollado computa estos patrones y permite entrenar un modelo FastText (basado en skip-gram) para aprender una representación espacial de las secuencias. A partir de estudiar la composición y naturaleza de los MRs, definimos tres criterios de filtrado de patrones para construir tres corpus de entrenamiento distintos. Analizamos los espacios resultantes de estos tres modelos aplicando las etiquetas originales de familias sobre las secuencias y mostramos que la representación vectorial captura de forma no supervisada relaciones intrínsecas de homología entre sus cadenas de aminoácidos. Mostramos que al entrenar los embeddings con todos los MRs computados, la separabilidad entre grupos de familias disminuye pero aumenta la capacidad de distinción entre secuencias sintéticas y naturales, mientras que al reducir la redundancia en el corpus de entrenamiento, una menor cantidad de redundancia en los MRs utilizados genera mejores agrupaciones pero dificulta más la distinción entre secuencias sintéticas y naturales, particularmente las que responden a un reordenamiento aleatorio de sus aminoácidos. Gracias a transformaciones realizadas con t-SNE, presentamos visualizaciones de los espacios resultantes para estudiar la estructura de los clústers formados. Observamos que al aumentar el valor de perplexity, estas transformaciones amplifican la separación de los clústers, a costa de alterar las distancias locales entre objetos vecinos, y sus resultados están fuertemente determinados por la calidad de las agrupaciones presentes en el espacio original de alta dimensionalidad. Por último, planteamos nuevos experimentos y mejoras posibles para construir un clasificador de secuencias de proteínas que pueda ser utilizado en aplicaciones reales.
Abstract:
The study of protein homology and its classification into families are pillars of molecular biology, but traditional methods are often costly, slow, and dependent on heuristics with multiple tunable parameters. This work introduces an unsupervised strategy to address this challenge, aiming to represent the protein sequence space in a way that allows distan- ces with biological meaning to be measured. The proposed method is based on constructing embeddings by defining a “biological vocabulary” based on the maximal repeats (MRs) of amino acids present in a corpus of sequences. The developed pipeline computes these patterns and allows training a FastText model (based on skip-gram) to learn a spatial representation of the sequences. By studying the composition and nature of the MRs, we define three pattern filtering criteria to construct three distinct training corpora. We analyze the resulting spaces from these three models by applying the original family labels to the sequences and show that the vector representation captures, in an unsupervised manner, intrinsic homology relationships among their amino acid chains. We demonstrate that when training the embeddings with all computed MRs, separability between family groups decreases but the ability to distinguish between synthetic and natural sequences increases, while when reducing redundancy in the training corpus, lower redundancy in the MRs used generates better groupings but makes it more difficult to distinguish between synthetic and natural sequences, particularly those resulting from random rearrangement of their amino acids. Thanks to transformations performed with t-SNE, we present visua- lizations of the resulting spaces to study the structure of the clusters formed. We observe that increasing the perplexity value amplifies cluster separation at the cost of altering local distances between neighboring objects, and their results are strongly determined by the quality of the groupings present in the original high-dimensional space. Finally, we propose new experiments and possible improvements to build a protein sequence classifier that can be used in real applications.
Citación:
---------- APA ----------
Giordano, Mauro. (2025). Estudio de la homología de proteínas mediante embeddings basados en repeticiones maximales de sus secuencias. (Tesis de Grado. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales.). Recuperado de https://hdl.handle.net/20.500.12110/seminario_nCOM000892_Giordano
---------- CHICAGO ----------
Giordano, Mauro. "Estudio de la homología de proteínas mediante embeddings basados en repeticiones maximales de sus secuencias". Tesis de Grado, Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales, 2025.https://hdl.handle.net/20.500.12110/seminario_nCOM000892_Giordano
Estadísticas:
Descargas mensuales
Total de descargas desde :
https://bibliotecadigital.exactas.uba.ar/download/seminario/seminario_nCOM000892_Giordano.pdf
Distrubución geográfica