中文

LEMMA:利用外部知识增强实现 LVLM 增强的多模态虚假信息检测

计算与语言 2024-06-24 v2

摘要

社交平台上多模态虚假信息的兴起对个人和社会构成了重大挑战。与纯文本虚假信息相比,其更高的可信度和更广泛的影响使得检测变得复杂,需要跨多种媒体类型进行稳健推理,并具备深厚的知识以进行准确验证。大型视觉语言模型(LVLM)的出现为这一问题提供了潜在的解决方案。凭借其在处理视觉和文本信息方面的专长,LVLM 展现出识别复杂信息和强大推理能力的潜力。在本文中,我们首先研究了 LVLM 在多模态虚假信息检测方面的潜力。我们发现,尽管 LVLM 的性能优于大型语言模型(LLM),但在缺乏证据的情况下,其深度推理能力可能有限。基于这些观察,我们提出了 LEMMA:一种利用外部知识增强的 LVLM 增强型多模态虚假信息检测方法。LEMMA 利用 LVLM 的直觉和推理能力,并通过外部知识对其进行增强,以提高虚假信息检测的准确性。我们的方法在 Twitter 和 Fakeddit 数据集上,相较于顶级基线 LVLM,准确率分别提高了 7% 和 13%。

关键词

引用

@article{arxiv.2402.11943,
  title  = {LEMMA: Towards LVLM-Enhanced Multimodal Misinformation Detection with External Knowledge Augmentation},
  author = {Keyang Xuan and Li Yi and Fan Yang and Ruochen Wu and Yi R. Fung and Heng Ji},
  journal= {arXiv preprint arXiv:2402.11943},
  year   = {2024}
}