中文

大型视觉语言模型也是优秀的分类器:基于零样本的多模态虚假新闻检测研究

计算与语言 2025-04-17 v4 人工智能 机器学习

摘要

大型视觉语言模型(LVLMs)在多种跨模态基准测试中展现出卓越的视觉语言推理能力。尽管如此,近期研究表明,大型语言模型(如 GPT-3.5-turbo)在虚假新闻检测(FND)任务中表现不佳,低于经过精心训练的较小模型(如 BERT)。本文首先评估了两款著名的 LVLMs(CogVLM 和 GPT4V)在 FND 任务中的能力,与一个较小却训练得当的 CLIP 模型进行了零样本情境下的比较。实验结果表明,LVLMs 能够实现与较小模型相当的性能。随后,我们将标准的零样本学习(ICL)与 LVLMs 集成,发现 FND 性能虽有提升,但受限于范围和一致性。为此,我们引入了“一”“多”“模”“式”“假”“新”“闻”“检”“测”(IMFND)框架,通过来自经过训练的较小模型的预测结果和相应概率丰富化零样本示例和测试输入。这种战略性整合引导 LVLMs 关注与更高概率相关的新闻片段,从而提高其分析准确性。实验结果表明,IMFND 框架显著提升了 LVLMs 在 FND 任务中的效率,在三个公开可用的 FND 数据集上均实现了超越标准 ICL 方法的准确率提升。

关键词

引用

@article{arxiv.2407.12879,
  title  = {Large Visual-Language Models Are Also Good Classifiers: A Study of In-Context Multimodal Fake News Detection},
  author = {Ye Jiang and Yimin Wang},
  journal= {arXiv preprint arXiv:2407.12879},
  year   = {2025}
}

备注

Withdraw for new experiments