On clustering and evaluation of narrow domain short-text corpora

Tesis doctoral de David Eduardo Pinto Avendaño

En este trabajo de tesis doctoral se investiga el problema del agrupamiento de conjuntos especiales de documentos llamados textos cortos de dominios restringidos. para llevar a cabo esta tarea, se han analizados diversos corpora y métodos de agrupamiento. Mas aún, se han introducido algunas medidas de evaluación de corpus, técnicas de selección de términos y medidas para la validez de agrupamiento con la finalidad de estudiar los siguientes problemas: -determinar la relativa dificultad de un corpus para ser agrupado y estudiar algunas de sus características como longitud de los textos, amplitud del dominio, estilometría, desequilibrio de clases y estructura. -contribuir en el estado del arte sobre el agrupamiento de corpora compuesto de textos cortos de dominios restringidos el trabajo de investigación que se ha llevado a cabo se encuentra parcialmente enfocado en el «agrupamiento de textos cortos». Este tema se considera relevante dado el modo actual y futuro en que las personas tienden a usar un «lenguaje reducido» constituidos por textos cortos (por ejemplo, blogs, snippets, noticias y generación de mensajes de textos como el correo electrónico y el chat). adicionalmente, se estudia la amplitud del dominio de corpora. En este sentido, un corpus puede ser considerado como restringido o amplio si el grado de traslape de vocabulario es alto o bajo, respectivamente. En la tarea de categorización, es bastante complejo lidiar con corpora de dominio restringido tales como artículos científicos, reportes técnicos, patentes, etc. el objetivo principal de este trabajo consiste en estudiar las posibles estrategias para tratar con los siguientes dos problemas: a) las bajas frecuencias de los términos del vocabulario en textos cortos, y b) el alto traslape de vocabulario asociado a dominios restringidos. si bien, cada uno de los problemas anteriores es un reto suficientemente alto, cuando se trata con textos cortos de dominios restringidos, la complejidad del problema se incr

 

Datos académicos de la tesis doctoral «On clustering and evaluation of narrow domain short-text corpora«

  • Título de la tesis:  On clustering and evaluation of narrow domain short-text corpora
  • Autor:  David Eduardo Pinto Avendaño
  • Universidad:  Politécnica de Valencia
  • Fecha de lectura de la tesis:  15/07/2008

 

Dirección y tribunal

  • Director de la tesis
    • Paolo Rosso
  • Tribunal
    • Presidente del tribunal: manuel Palomar sanz
    • eneko Agirre bengoa (vocal)
    • benno María Stein (vocal)
    • Luis alfonso Ureña lópez (vocal)

 

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Scroll al inicio