中文

使用大型视觉-语言模型进行多模态错误信息检测

计算与语言 2024-07-22 v1 信息检索 多媒体

摘要

错误信息的日益泛滥及其令人担忧的影响,促使工业界和学术界开发错误信息检测与事实核查的方法。大型语言模型 (LLM) 的最新进展已在各种任务中展现出卓越的性能,但 LLM 是否以及如何帮助错误信息检测仍相对未被充分探索。现有的大多数最先进方法要么不考虑证据而仅关注声明相关特征,要么假设证据已被提供。很少有方法将证据检索视为错误信息检测的一部分,但它们依赖于微调模型。在本文中,我们研究了 LLM 在零样本设置下进行错误信息检测的潜力。我们将一个证据检索组件整合到流程中,因为从各种来源收集相关信息对于检测声明的真实性至关重要。为此,我们提出了一种新颖的重排序方法,使用 LLM 和大型视觉语言模型(LVLM)进行多模态证据检索。检索到的证据样本(图像和文本)作为基于 LVLM 的多模态事实验证方法(LVLM4FV)的输入。为了实现公平评估,我们通过为图像和文本检索标注更完整的证据样本集,解决了现有证据检索数据集中证据样本真实情况不完整的问题。我们在两个数据集上的实验结果表明,所提出的方法在证据检索和事实验证任务中均具有优越性,并且与有监督基线相比,具有更好的跨数据集泛化能力。

关键词

引用

@article{arxiv.2407.14321,
  title  = {Multimodal Misinformation Detection using Large Vision-Language Models},
  author = {Sahar Tahmasebi and Eric Müller-Budack and Ralph Ewerth},
  journal= {arXiv preprint arXiv:2407.14321},
  year   = {2024}
}

备注

Accepted for publication in: Conference on Information and Knowledge Management (CIKM) 2024