Stanceosaurus:面向多语言错误信息的立场分类
计算与语言
2022-10-31 v1
摘要
我们提出 Stanceosaurus,一个包含 28,033 条英语、印地语和阿拉伯语推文的新语料库,标注了针对 251 条错误信息声明的立场。据我们所知,它是标注针对错误信息声明立场的最大语料库。Stanceosaurus 中的声明源自 15 个覆盖不同地理区域和文化的事实核查来源。与现有立场数据集不同,我们引入了更细粒度的 5 类标注策略及额外子类别以区分隐式立场。在我们的语料库上微调的预训练基于 transformer 的立场分类器在未见声明和来自训练数据以外国家的区域声明上表现出良好的泛化能力。跨语言实验展示了 Stanceosaurus 训练多语言模型的能力,在无任何目标语言微调的情况下,印地语上达到 53.1 F1、阿拉伯语上达到 50.4 F1。最后,我们展示了如何使用领域自适应方法利用额外的 RumourEval-2019 数据提升在 Stanceosaurus 上的性能。我们将 Stanceosaurus 公开给研究界,并希望它能鼓励针对跨语言跨文化的错误信息识别开展进一步工作。
引用
@article{arxiv.2210.15954,
title = {Stanceosaurus: Classifying Stance Towards Multilingual Misinformation},
author = {Jonathan Zheng and Ashutosh Baheti and Tarek Naous and Wei Xu and Alan Ritter},
journal= {arXiv preprint arXiv:2210.15954},
year = {2022}
}
备注
Accepted to EMNLP 2022 main conference