BRIGHTER:桥接人类标注情感识别数据集在28种语言中的差距
计算与语言
2025-05-30 v4
摘要
全球人民以微妙且复杂的方式表达情感。尽管情感识别——作为几种自然语言处理任务的统称——对NLP领域内的各种应用以及外部应用产生深远影响,但该领域的大多数研究工作主要聚焦于高资源语言。这导致研究努力和提出的解决方案在特别缺乏高质量标注数据集的资源语言方面存在显著差异。本文提出BRIGHTER——一个包含28种不同语言中多标签、情感标注数据集的集合,涵盖多个领域。BRIGHTER主要覆盖非洲、亚洲、东欧和拉美的低资源语言,实例由流利的说话者标注。我们概述了数据收集和标注过程中的挑战,然后报告了单语和跨语种多标签情感识别,以及情感强度识别的实验结果。我们分析了在使用和不使用大型语言模型(LLMs)的情况下,不同语言和文本领域之间性能差异,并表明BRIGHTER数据集代表了针对文本基于情感的识别所取得的有意义进步。
引用
@article{arxiv.2502.11926,
title = {BRIGHTER: BRIdging the Gap in Human-Annotated Textual Emotion Recognition Datasets for 28 Languages},
author = {Shamsuddeen Hassan Muhammad and Nedjma Ousidhoum and Idris Abdulmumin and Jan Philip Wahle and Terry Ruas and Meriem Beloucif and Christine de Kock and Nirmal Surange and Daniela Teodorescu and Ibrahim Said Ahmad and David Ifeoluwa Adelani and Alham Fikri Aji and Felermino D. M. A. Ali and Ilseyar Alimova and Vladimir Araujo and Nikolay Babakov and Naomi Baes and Ana-Maria Bucur and Andiswa Bukula and Guanqun Cao and Rodrigo Tufino Cardenas and Rendi Chevi and Chiamaka Ijeoma Chukwuneke and Alexandra Ciobotaru and Daryna Dementieva and Murja Sani Gadanya and Robert Geislinger and Bela Gipp and Oumaima Hourrane and Oana Ignat and Falalu Ibrahim Lawan and Rooweither Mabuya and Rahmad Mahendra and Vukosi Marivate and Alexander Panchenko and Andrew Piper and Charles Henrique Porto Ferreira and Vitaly Protasov and Samuel Rutunda and Manish Shrivastava and Aura Cristina Udrea and Lilian Diana Awuor Wanzare and Sophie Wu and Florian Valentin Wunderlich and Hanif Muhammad Zhafran and Tianhui Zhang and Yi Zhou and Saif M. Mohammad},
journal= {arXiv preprint arXiv:2502.11926},
year = {2025}
}
备注
Accepted at ACL2025 (Main)