AVerImaTeC:基于网络证据的图像-文本声明自动验证数据集
计算与语言
2025-10-08 v2
摘要
文本声明常附有图像以增强其可信度并在社交媒体上传播,但这也引发了关于错误信息传播的担忧。现有的图像-文本声明自动验证数据集仍然有限,因为它们通常由合成声明组成,且缺乏用于捕捉判断推理过程的证据标注。在本工作中,我们引入了AVerImaTeC,一个包含1,297个真实世界图像-文本声明数据集。每个声明都标注了包含网络证据的问答对,反映了关于判断的分解推理。我们通过声明规范化、时间约束证据标注和两阶段充分性检查,缓解了事实核查数据集中的常见挑战,如上下文依赖性、时间泄漏和证据不足。我们通过标注者间研究评估了AVerImaTeC标注的一致性,在判断上达到κ=0.742,在问答对上达到74.7%的一致性。我们还提出了一种新颖的证据检索评估方法,并进行了广泛实验以建立基于开放网络证据验证图像-文本声明的基线。
引用
@article{arxiv.2505.17978,
title = {AVerImaTeC: A Dataset for Automatic Verification of Image-Text Claims with Evidence from the Web},
author = {Rui Cao and Zifeng Ding and Zhijiang Guo and Michael Schlichtkrull and Andreas Vlachos},
journal= {arXiv preprint arXiv:2505.17978},
year = {2025}
}
备注
accepted at NeurIPS 2025 Datasets and Benchmarks Track