RoIt-XMASA:面向罗马尼亚语和意大利语的多域多语言情感分析数据集
计算与语言
2026-05-25 v2
摘要
我们提出RoIt-XMASA,一个扩展了跨语言多域亚马逊情感分析数据集至意大利语和罗马尼亚语的数据集,包含36,000个标记的评论,涵盖三个领域(书籍、电影和音乐),以及202,141个未标记的样本。为解决跨语言和跨域挑战,我们提出了一种多目标对抗训练框架,采用具有元学习系数的损失反转来动态平衡情感判别与域和语言不变性。XLM-R在我们的方法下实现66.23%的F1分数,超过基线4.64%。零样本评估显示,Llama-3.1-8B实现了58.43%的F1分数,这揭示了基于提示的效率方法与任务特定微调的更高性能之间的有意义的权衡。
引用
@article{arxiv.2604.17134,
title = {RoIt-XMASA: Multi-Domain Multilingual Sentiment Analysis Dataset for Romanian and Italian},
author = {Andrei-Marius Avram and Aureliu Valentin Antonie and Cosmin-Mircea Croitoru and Vlad Andrei Muntean and Dumitru-Clementin Cercel},
journal= {arXiv preprint arXiv:2604.17134},
year = {2026}
}
备注
Accepted at the International AAAI Conference on Web and Social Media (ICWSM 2026)