中文

MultiCaption:用于检测多语言视觉声明的虚假信息

计算与语言 2026-01-19 v1

摘要

网络虚假信息正日益威胁社会,其传播越来越快,涉及多媒体和多语言平台。虽然自动事实核查方法近年来取得了进展,但其有效性仍受限于反映这些真实复杂性的数据集稀缺。为此,我们首先提出 MultiCaption,一个专为检测视觉声明矛盾而设计的新数据集。该数据集包含 11,088 条涉及 64 种语言的视觉声明,通过多种策略对其进行标注,以确定它们是否相互矛盾。该数据集为构建和评估多模态、多语言环境中虚假信息检测系统提供了独特资源。我们随后对基于变换器架构、自然语言推理模型和大型语言模型进行了全面实验,为未来研究建立了强基线。结果表明,MultiCaption 比标准 NLI 任务更具挑战性,需要针对性微调才能获得佳绩。此外,多语言训练和测试的提升显示,该数据集在不依赖机器翻译的情况下构建有效多语言事实核查管道的潜力。

关键词

引用

@article{arxiv.2601.11220,
  title  = {MultiCaption: Detecting disinformation using multilingual visual claims},
  author = {Rafael Martins Frade and Rrubaa Panchendrarajan and Arkaitz Zubiaga},
  journal= {arXiv preprint arXiv:2601.11220},
  year   = {2026}
}