FKA-Owl:通过知识增强的 LVLM 推进多模态假新闻检测
计算与语言
2024-08-07 v2
摘要
大量涉及文本和图像的多模态假新闻的生成表现出显著的分布差异,促使了对泛化检测器的需求。然而,训练的孤立性质限制了经典检测器获取开放世界事实的能力。虽然大型视觉语言模型(LVLM)已经编码了丰富的世界知识,但它们本质上并非为对抗假新闻而定制,并且在理解局部伪造细节方面存在困难。在本文中,我们提出了 FKA-Owl,这是一个利用特定伪造知识来增强 LVLM 的新框架,使其能够有效地推理篡改行为。增强的特定伪造知识包括文本与图像之间的语义相关性,以及图像操作中的伪影痕迹。为了将这两种知识注入 LVLM,我们设计了两个专门的模块来分别建立它们的表示。然后将编码的知识嵌入整合到 LVLM 中。在公共基准上的大量实验表明,与以前的方法相比,FKA-Owl 取得了优异的跨域性能。代码已在 https://liuxuannan.github.io/FKA_Owl.github.io/ 公开提供。
引用
@article{arxiv.2403.01988,
title = {FKA-Owl: Advancing Multimodal Fake News Detection through Knowledge-Augmented LVLMs},
author = {Xuannan Liu and Peipei Li and Huaibo Huang and Zekun Li and Xing Cui and Jiahao Liang and Lixiong Qin and Weihong Deng and Zhaofeng He},
journal= {arXiv preprint arXiv:2403.01988},
year = {2024}
}
备注
Accepted by ACM MM 2024.Project page: https://liuxuannan.github.io/FKA_Owl.github.io/