中文

规模化合成数据下的多语言多标签情感分类

计算与语言 2026-04-15 v1

摘要

多语言情感分类受限于标注数据的稀缺性:现有语料库主要是英文的、单标签的,并且覆盖的语言较少。为填补这一空白,我们构建了一个规模化的合成训练语料库,包含超过100万个多标签样本(每个语言5万个),覆盖23种语言:阿拉伯语、孟加拉语、荷兰语、英语、法语、德语、印地语、印尼语、意大利语、日语、韩语、普通话、波兰语、葡萄牙语、旁遮普语、俄语、西班牙语、斯瓠希拉语、泰米尔语、土耳其语、乌克兰语、乌尔都语和越南语,涵盖11个情感类别,并采用文化适应的生成方式和程序化质量筛选。我们在相同的条件下训练和比较了六个多语言变换器编码器,从DistilBERT(1.35亿参数)到XLM-R-Large(5.6亿参数)。在我们的领域内测试集上,XLM-R-Large实现了0.868的 F1-micro 和0.987的 AUC-micro。为验证与人工标注数据的一致性,我们在GoEmotions(英语)和SemEval-2018任务1E-c(英语、阿拉伯语、西班牙语)上进行零样本评估。在阈值自由的排序指标上,XLM-R-Large在AP-micro(0.636)和LRAP(0.804)上与英语专家模型持平或超越,在AUC-micro(0.810 vs. 0.787)上进一步提升,并原生支持所有23种语言。最佳的 base 大小模型已公开发布于 https://huggingface.co/tabularisai/multilingual-emotion-classification。

关键词

引用

@article{arxiv.2604.12633,
  title  = {Multilingual Multi-Label Emotion Classification at Scale with Synthetic Data},
  author = {Vadim Borisov},
  journal= {arXiv preprint arXiv:2604.12633},
  year   = {2026}
}