中文

基于动态加权处理标签不平衡的百种语言多标签情感分析

机器学习 2022-02-08 v1 计算与语言 机器学习

摘要

我们研究跨语言情感分析,因其在市场研究、政治与社会科学等领域的应用而备受关注。特别地,我们引入多标签设定下的情感分析框架,因其遵循 Plutchik 情绪轮。我们提出一种新颖的动态加权方法,在训练期间平衡各类的贡献,不同于先前基于类频率分配不变权重的静态加权方法。此外,我们将单标签目标识别文献中偏好困难样本的 focal loss 适配至我们的多标签设定。进而,我们推导出一种以线性时间复杂度选择最大化 macro-f1 分数的类特定阈值的方法。通过大量实验,我们表明相较于 SemEval 竞赛中的常见基线及最优方法,我们的方法使用单一模型在 3 种不同语言的 9 项指标中的 7 项上取得了 SOTA 性能。我们公开分享了可于 100 种语言中执行情感分析的模型代码,以促进进一步研究。

关键词

引用

@article{arxiv.2008.11573,
  title  = {Multi-Label Sentiment Analysis on 100 Languages with Dynamic Weighting for Label Imbalance},
  author = {Selim F. Yilmaz and E. Batuhan Kaynak and Aykut Koç and Hamdi Dibeklioğlu and Suleyman S. Kozat},
  journal= {arXiv preprint arXiv:2008.11573},
  year   = {2022}
}

备注

11 pages, 6 figures