增强埃塞俄比亚语言的多标签情感分析及其对应强度
计算与语言
2026-03-20 v2
摘要
开发和集成情感理解模型对于包括客户反馈分析、营销研究和社交媒体监控在内的广泛人机交互任务至关重要。鉴于用户经常在单个实例中同时表达多种情感,对情感数据集进行多标签格式标注对于捕捉这种复杂性至关重要。埃塞俄比亚情感数据集(EthioEmo)是一个多语言、多标签情感数据集,但缺乏情感强度标注,这对于区分情感表达的不同程度至关重要,因为并非所有情感都以相同强度表达。我们扩展了EthioEmo数据集以弥补这一差距,通过添加情感强度标注。此外,我们对该丰富数据集上的先进编码器-only预训练语言模型(PLMs)和大型语言模型(LLMs)进行基准测试。我们的结果表明,面向非洲的编码器-only模型在各种情感理解任务中持续优于开源LLMs,这凸显了在情感理解中结合文化和语言特性的小型模型的重要性。将情感强度特征纳入多标签情感分类可获得更佳性能。该数据可在https://huggingface.co/datasets/Tadesse/EthioEmo-intensities获取。
引用
@article{arxiv.2503.18253,
title = {Enhancing Multi-Label Emotion Analysis and Corresponding Intensities for Ethiopian Languages},
author = {Tadesse Destaw Belay and Dawit Ketema Gete and Abinew Ali Ayele and Olga Kolesnikova and Iqra Ameer and Grigori Sidorov and Seid Muhie Yimam},
journal= {arXiv preprint arXiv:2503.18253},
year = {2026}
}
备注
LREC 2026