巴斯克语与西班牙语反叙事生成:数据创建与评估
计算与语言
2024-03-15 v1
摘要
反叙事是对仇恨言论的非负面文本回应,旨在化解网络仇恨并减轻其在媒体间的传播。尽管近期在线发布的仇恨言论内容有所增加,但关于自动反叙事生成的研究相对较少,且主要集中在英语上。本文提出了 CONAN-EUS,一个用于反叙事生成的巴斯克语和西班牙语新数据集,通过机器翻译(MT)和专业译后编辑开发而成。作为平行语料库,其与原始英语 CONAN 也平行,从而允许对反叙事的多语言和跨语言自动生成进行新颖研究。我们使用 mT5(一种多语言编码器-解码器模型)进行反叙事生成实验,结果表明,在译后编辑数据上进行训练极大地促进了生成效果,而非仅依赖银标准机器翻译数据。这些结果与定性人工评估的相关性相印证,表明人工修订的训练数据对于生成反叙事的质量仍然至关重要。此外,对于英语和西班牙语等结构相似的语言,多语言数据增强在单语设置基础上改善了结果,但对于巴斯克语这一孤立语言则是不利的。在零样本跨语言评估中也出现了类似发现,其中模型迁移(在英语上微调并在不同目标语言中生成)在西班牙语上优于在机器翻译数据上微调 mT5 的效果,但在巴斯克语上则不然。这为生成模型多语言性的不对称性提供了有趣的见解,该挑战性课题仍有待进一步研究。
引用
@article{arxiv.2403.09159,
title = {Basque and Spanish Counter Narrative Generation: Data Creation and Evaluation},
author = {Jaione Bengoetxea and Yi-Ling Chung and Marco Guerini and Rodrigo Agerri},
journal= {arXiv preprint arXiv:2403.09159},
year = {2024}
}
备注
Accepted for the Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING) 2024