中文

印地语-英语混合语情感分析的课程学习策略

计算与语言 2019-06-19 v1

摘要

情感分析及其他语义任务常用于社交媒体文本分析,以衡量公众舆论并从社交媒体的噪声中提取信息。社交媒体上使用的语言不仅通常偏离正式语言,还因语言间的混合语(codemixing)而更加复杂,在印度这样的大型多语社会中尤为明显。传统的语义 NLP 任务学习方法长期依赖端到端特定任务训练,需要昂贵的数据创建过程,深度学习方法更是如此。对于像混合语对这样资源稀缺的文本,这一挑战更为严峻:缺乏良好学习的表示作为模型先验,且特定任务数据集数量少、规模小,难以有效利用近期深度学习方法。为应对上述挑战,我们针对印地语-英语(Hi-En)混合语文本中的语义任务引入课程学习策略,并研究多种提升模型性能的训练策略。我们的方法在 Hi-En 混合语情感分析上以 3.31% 的准确率优于当前最优(state of the art)方法,并在收敛性和测试性能方差方面表现出更好的模型鲁棒性。

关键词

引用

@article{arxiv.1906.07382,
  title  = {Curriculum Learning Strategies for Hindi-English Codemixed Sentiment Analysis},
  author = {Anirudh Dahiya and Neeraj Battan and Manish Shrivastava and Dipti Mishra Sharma},
  journal= {arXiv preprint arXiv:1906.07382},
  year   = {2019}
}