C1 在 SemEval-2020 任务 9 的工作:SentiMix:基于特征工程的混合语码社交媒体文本情感分析
计算与语言
2020-09-01 v1 机器学习
摘要
在当今互联互通且多语并存的世界中,社交媒体上的语言混合语码现象十分常见。尽管许多自然语言处理 (NLP) 任务(如情感分析)已较为成熟且专为单语文本设计,但将这些任务应用于混合语码文本的技术仍值得探索。本文描述了我们针对 SemEval-2020 任务 9:SentiMix 的混合语码社交媒体文本情感分析所采用的特征工程方法。我们通过利用一组手工设计的词汇、情感与元数据特征来设计一个可区分“正面”、“负面”与“中性”情感的分类器以应对该问题。借助此模型,我们在“Hinglish”任务上获得了 0.65 的加权 F1 分数,在“Spanglish”任务上获得了 0.63 的加权 F1 分数。
引用
@article{arxiv.2008.13549,
title = {C1 at SemEval-2020 Task 9: SentiMix: Sentiment Analysis for Code-Mixed Social Media Text using Feature Engineering},
author = {Laksh Advani and Clement Lu and Suraj Maharjan},
journal= {arXiv preprint arXiv:2008.13549},
year = {2020}
}
备注
SemEval-2020 Task 9