EmoBench-UA:面向乌克兰语情感检测的基准数据集
计算与语言
2025-09-29 v2
摘要
尽管乌克兰语自然语言处理在许多文本处理任务中取得了进展,但情感分类仍是一个未被充分探索的领域,迄今为止没有公开可用的基准。在这项工作中,我们引入了 EmoBench-UA,这是第一个用于乌克兰语文本情感检测的标注数据集。我们的标注模式改编自先前以英语为中心的情感检测工作(Mohammad et al., 2018; Mohammad, 2022)的指南。该数据集通过使用 Toloka.ai 平台众包创建,确保了标注过程的高质量。然后,我们在收集的数据集上评估了一系列方法,从基于语言学的基线、从英语翻译的合成数据,到大语言模型(LLMs)。我们的研究结果突显了在乌克兰语等非主流语言中进行情感分类的挑战,并强调需要进一步开发针对乌克兰语的特定模型和训练资源。
引用
@article{arxiv.2505.23297,
title = {EmoBench-UA: A Benchmark Dataset for Emotion Detection in Ukrainian},
author = {Daryna Dementieva and Nikolay Babakov and Alexander Fraser},
journal= {arXiv preprint arXiv:2505.23297},
year = {2025}
}
备注
EMNLP2025, Findings