用 MMTweets 打破语言壁垒:推进面向事实核查的跨语言辟谣叙事检索
计算与语言
2024-08-21 v2 计算机与社会
信息检索
机器学习
社会与信息网络
摘要
寻找先前已被辟谣的叙事涉及识别已经过事实核查的声称。当相似的虚假声称以多种语言持续存在,而另一种语言中已有数月之久的辟谣时,这一问题愈发严重。因此,自动以多种语言查找辟谣(或事实核查)对于充分利用稀缺的事实核查员资源至关重要。主要由于现成数据的缺乏,这是一个研究不足的问题,尤其是在考虑跨语言场景时,即检索与待核查在线帖子语言不同的辟谣。本研究引入跨语言辟谣叙事检索,并通过以下方式解决这一研究空白:(i) 创建多语言错误信息推文(MMTweets):一个独具特色的数据集,具有跨语言对、图像、人工标注和细粒度标签,使其成为相较同类更为全面的资源;(ii) 开展广泛实验以基准测试最先进的跨语言检索模型,并引入为该任务量身定制的多阶段检索方法;以及 (iii) 在 MMTweets 内全面评估检索模型的跨语言与跨数据集迁移能力,并进行检索延迟分析。我们发现 MMTweets 对跨语言辟谣叙事检索提出了挑战,凸显了检索模型有待改进之处。尽管如此,该研究为创建 MMTweets 数据集和优化辟谣叙事检索模型以支持事实核查工作提供了宝贵见解。数据集与标注手册公开于 https://doi.org/10.5281/zenodo.10637161。
引用
@article{arxiv.2308.05680,
title = {Breaking Language Barriers with MMTweets: Advancing Cross-Lingual Debunked Narrative Retrieval for Fact-Checking},
author = {Iknoor Singh and Carolina Scarton and Xingyi Song and Kalina Bontcheva},
journal= {arXiv preprint arXiv:2308.05680},
year = {2024}
}