中文

CoVLM: 利用视觉语言模型的共识进行半监督多模态假新闻检测

计算机视觉与模式识别 2024-10-08 v1

摘要

在这项工作中,我们解决了现实世界中具有挑战性的脱离上下文错误信息检测任务,其中真实图像与不正确的标题配对以制造假新闻。现有方法假设有大量标记数据可用,这在现实世界中往往不切实际,因为它需要大量的人工干预和领域专业知识。相比之下,由于获取大量未标记的图像-文本对要容易得多,我们在此提出一种半监督协议,其中模型可以访问有限数量的标记图像-文本对和大量未标记对。此外,由于假新闻的发生率远低于真实新闻,数据集往往高度不平衡,从而使任务更具挑战性。为此,我们提出了一个新颖的框架,即视觉语言模型的共识(CoVLM),该框架利用从标记数据中导出的阈值,为未标记对生成稳健的伪标签。这种方法可以自动确定模型用于选择置信伪标签的正确阈值参数。在基准数据集上跨挑战性条件的实验结果以及与最先进方法的比较证明了我们框架的有效性。

关键词

引用

@article{arxiv.2410.04426,
  title  = {CoVLM: Leveraging Consensus from Vision-Language Models for Semi-supervised Multi-modal Fake News Detection},
  author = {Devank and Jayateja Kalla and Soma Biswas},
  journal= {arXiv preprint arXiv:2410.04426},
  year   = {2024}
}

备注

Accepted in ACCV 2024