A Sentiment Analysis Model of Spanish Tweets. Case Study: Colombia 2014 Presidential Election

Cerón-Guzmán, Jhon Adrián

Mostrar el registro sencillo del documento

dc.rights.license	Atribución-NoComercial 4.0 Internacional
dc.contributor.advisor	León-Guzmán, Elizabeth (Thesis advisor)
dc.contributor.author	Cerón-Guzmán, Jhon Adrián
dc.date.accessioned	2019-07-02T11:53:15Z
dc.date.available	2019-07-02T11:53:15Z
dc.date.issued	2016-05-25
dc.identifier.uri	https://repositorio.unal.edu.co/handle/unal/56482
dc.description.abstract	Abstract. What people say on social media has turned into a rich source of information to understand social behavior. Sentiment analysis of Twitter data has been widely used to capture trends in public opinion regarding important events such as political elections. However, current research in social media analysis in political domains faces two major problems, namely: sentiment analysis methods implemented are often too simple, and most of the researches have assumed that all users and their tweets are trustworthy. This thesis is aimed at dealing with these problems to achieve more reliable public opinion measurements. Colombia 2014 presidential election was proposed as case study. First, a research on social spammer detection on Twitter was carried out by following machine learning approaches to distinguish spammer accounts from non-spammer ones. Because of the brevity of tweets and the widespread use of mobile devices, Twitter is also a rich source of noisy data containing many non-standard word forms. Since this is a task that exploits the large amount of user-generated texts, the performance of sentiment analysis may drop significantly if several lexical variation phenomena are not dealt with. For that reason, a lexical normalization system of Spanish tweets was developed to improve the quality of natural language analysis, using finite-state transducers and statistical language modeling. Lastly, a sentiment analysis system of Spanish tweets was developed by implementing a supervised classification approach. The system was applied in the Colombian election to infer voting intention. Experimental results highlight the importance of denoising in Twitter data to achieve more reliable public opinion measurements. Together with this, results show the potential of social media analysis to infer vote share, obtaining the lowest mean absolute error and correctly ranking the highest-polling candidates in the first round election. However, such an important method cannot be put forward as a substitute of the traditional polling.
dc.description.abstract	Lo que las personas dicen en plataformas de social media se ha convertido en una fuente valiosa de información para entender el comportamiento social. Análisis de sentimientos de datos de Twitter se ha utilizado ámpliamente para capturar tendencias en la opinión pública con respecto a temas importantes como los son las elecciones políticas. Sin embargo, la investigación actual sobre aplicaciones de análisis de social media en contextos políticos enfrenta dos grandes problemas, a saber: se han empleado los métodos más simples de análisis de sentimientos, y se ha asumido que todos los usuarios y sus tweets son dignos de confianza. Esta tesis tiene como objetivo hacer frente a estos problemas con el fin de alcanzar mediciones más fiables de la opinión pública. Las elecciones presidenciales en Colombia de 2014 se propusieron como caso de estudio. En primer lugar, se llevó a cabo una investigación sobre la detección de spammers en Twitter, implementando enfoques de aprendizaje automático para distinguir cuentas spammers de las que no lo son. Debido a la brevedad de los tweets y al ámplio uso de dispositivos móviles, Twitter se ha convertido en una fuente de datos ruídosos que contiene muchas formas de palabra que no son estándar. Al tratarse de una tarea que explota la gran cantidad de texto generado por los usuarios, el desempeño de análisis de sentimientos podría degradarse si no se abordan varios fenómenos de variación léxica presentes en los tweets. Por esta razón, se desarrolló un sistema de normalización léxica de tweets en español, el cual emplea transductores de estado finito y modelado de lenguaje estadístico, a fin de mejorar la calidad del análisis del lenguaje natural. Por último, se desarrolló un sistema de análisis de sentimientos de tweets en español siguiendo un enfoque de clasificación supervisada, el cual se aplicó en el contexto de las citadas elecciones para realizar inferencia de intención de voto. Los resultados experimentales resaltan la importancia de eliminar el ruído de los datos de Twitter que se utilizan para realizar mediciones de la opinión pública. Junto con esto, los resultados muestran el potencial del análisis de social media para inferir la distribución de los votos, obteniendo la media del error absoluto más baja y correctamente clasificando los candidatos de mayor votación en la primera vuelta electoral. Sin embargo, dicho método no puede plantearse como un sustituto del sondeo electoral tradicional.
dc.format.mimetype	application/pdf
dc.language.iso	spa
dc.relation.ispartof	Universidad Nacional de Colombia Sede Bogotá Facultad de Ingeniería Departamento de Ingeniería de Sistemas e Industrial
dc.relation.ispartof	Departamento de Ingeniería de Sistemas e Industrial
dc.rights	Derechos reservados - Universidad Nacional de Colombia
dc.rights.uri	http://creativecommons.org/licenses/by-nc/4.0/
dc.subject.ddc	0 Generalidades / Computer science, information and general works
dc.subject.ddc	38 Comercio, comunicaciones, transporte / Commerce, communications and transportation
dc.subject.ddc	46 Lenguas española y portuguesa / Specific languages
dc.title	A Sentiment Analysis Model of Spanish Tweets. Case Study: Colombia 2014 Presidential Election
dc.type	Trabajo de grado - Maestría
dc.type.driver	info:eu-repo/semantics/masterThesis
dc.type.version	info:eu-repo/semantics/acceptedVersion
dc.identifier.eprints	http://bdigital.unal.edu.co/52257/
dc.description.degreelevel	Maestría
dc.relation.references	Cerón-Guzmán, Jhon Adrián (2016) A Sentiment Analysis Model of Spanish Tweets. Case Study: Colombia 2014 Presidential Election. Maestría thesis, Universidad Nacional de Colombia - Sede Bogotá.
dc.rights.accessrights	info:eu-repo/semantics/openAccess
dc.subject.proposal	Social media
dc.subject.proposal	Twitter
dc.subject.proposal	Spanish tweets
dc.subject.proposal	Spammer detection
dc.subject.proposal	Lexical normalization
dc.subject.proposal	Sentiment analysis
dc.subject.proposal	Voting intention inference
dc.subject.proposal	Politics
dc.subject.proposal	Presidential election
dc.subject.proposal	Colombia
dc.subject.proposal	tweets en español
dc.subject.proposal	Detección de spammers
dc.subject.proposal	Normalización léxica
dc.subject.proposal	Análisis de sentimientos
dc.subject.proposal	Inferencia de intención de votación,
dc.subject.proposal	Política
dc.subject.proposal	Elecciones presidenciales
dc.type.coar	http://purl.org/coar/resource_type/c_bdcc
dc.type.coarversion	http://purl.org/coar/version/c_ab4af688f83e57aa
dc.type.content	Text
dc.type.redcol	http://purl.org/redcol/resource_type/TM
oaire.accessrights	http://purl.org/coar/access_right/c_abf2

Archivos en el documento

Nombre:: johnadrianceronguzman_2016.pdf
Tamaño:: 535.8Kb
Formato:: PDF

Descargar

Este documento aparece en la(s) siguiente(s) colección(ones)

Maestría en Ingeniería - Sistemas y Computación [311]

Mostrar el registro sencillo del documento

Atribución-NoComercial 4.0 Internacional

Esta obra está bajo licencia internacional Creative Commons Reconocimiento-NoComercial 4.0.Este documento ha sido depositado por parte de el(los) autor(es) bajo la siguiente constancia de depósito