面向语码转换数据的无监督自训练情感分析
计算与语言
2021-10-04 v2 机器学习
摘要
情感分析是理解社交媒体内容(如客户评论、Twitter 和 Facebook 动态等)的一项重要任务。在全球多语言社区中,大量社交媒体文本以语码转换(Code-Switching)为特征。因此,构建能够处理语码转换数据的模型变得十分重要。然而,带标注的语码转换数据十分稀缺,亟需无监督模型与算法。我们提出了一个称为无监督自训练(Unsupervised Self-Training)的通用框架,并展示了其在语码转换数据情感分析这一具体用例中的应用。我们利用预训练 BERT 模型的强大能力进行初始化,并以无监督方式对其微调,仅使用零样本迁移(zero-shot transfer)生成的伪标签。我们在多种语码转换语言上测试了我们的算法,并对算法的学习动态进行了详细分析,旨在回答以下问题——‘我们的无监督模型是理解了语码转换语言,还是仅仅学习了其表示?’。我们的无监督模型与有监督对应模型表现相当,在二分类问题上与有监督模型相比,其性能(加权 F1 分数)差距在 1-7% 以内。
引用
@article{arxiv.2103.14797,
title = {Unsupervised Self-Training for Sentiment Analysis of Code-Switched Data},
author = {Akshat Gupta and Sargam Menghani and Sai Krishna Rallabandi and Alan W Black},
journal= {arXiv preprint arXiv:2103.14797},
year = {2021}
}