面向语码转换非正式短文本情感分类的深度学习自适应方法
计算与语言
2020-04-07 v1
摘要
如今,大量受地区语言影响而采用非标准书写风格的短文本正在产生。即使是对于情感分类等热门任务,此类非正式且语码转换的内容在标注数据集和语言模型方面也资源匮乏。在这项工作中,我们(1)提出了一个称为MultiSenti的标注数据集,用于语码转换非正式短文本的情感分类,(2)探索了将资源丰富语言的资源迁移到非正式语言的可行性,以及(3)提出了一种基于深度学习的语码转换非正式短文本情感分类模型。我们的目标是在不进行任何词汇归一化、语言翻译或语码转换标注的情况下实现这一点。所提模型的性能与三种现有的多语言情感分类模型进行了比较。结果表明,所提模型总体表现更优,并且采用基于字符的嵌入进行自适应可获得相当的性能,同时在计算上比训练基于词的特定领域嵌入更高效。
引用
@article{arxiv.2001.01047,
title = {Adapting Deep Learning for Sentiment Classification of Code-Switched Informal Short Text},
author = {Muhammad Haroon Shakeel and Asim Karim},
journal= {arXiv preprint arXiv:2001.01047},
year = {2020}
}