中文

增强埃塞俄比亚语言的多标签情感分析及其对应强度

计算与语言 2026-03-20 v2

摘要

开发和集成情感理解模型对于包括客户反馈分析、营销研究和社交媒体监控在内的广泛人机交互任务至关重要。鉴于用户经常在单个实例中同时表达多种情感,对情感数据集进行多标签格式标注对于捕捉这种复杂性至关重要。埃塞俄比亚情感数据集(EthioEmo)是一个多语言、多标签情感数据集,但缺乏情感强度标注,这对于区分情感表达的不同程度至关重要,因为并非所有情感都以相同强度表达。我们扩展了EthioEmo数据集以弥补这一差距,通过添加情感强度标注。此外,我们对该丰富数据集上的先进编码器-only预训练语言模型(PLMs)和大型语言模型(LLMs)进行基准测试。我们的结果表明,面向非洲的编码器-only模型在各种情感理解任务中持续优于开源LLMs,这凸显了在情感理解中结合文化和语言特性的小型模型的重要性。将情感强度特征纳入多标签情感分类可获得更佳性能。该数据可在https://huggingface.co/datasets/Tadesse/EthioEmo-intensities获取。

关键词

引用

@article{arxiv.2503.18253,
  title  = {Enhancing Multi-Label Emotion Analysis and Corresponding Intensities for Ethiopian Languages},
  author = {Tadesse Destaw Belay and Dawit Ketema Gete and Abinew Ali Ayele and Olga Kolesnikova and Iqra Ameer and Grigori Sidorov and Seid Muhie Yimam},
  journal= {arXiv preprint arXiv:2503.18253},
  year   = {2026}
}

备注

LREC 2026