中文

基于软逻辑正则化的可解释多模态超出情境检测

计算机视觉与模式识别 2024-06-10 v1

摘要

移动设备和媒体的快速传播导致虚假或误导性信息的广泛传播,引发社会方面的广泛关注。其中,图像重用(即超出情境误导信息)极为常见且有效。然而,现有用于检测超出情境误导信息的方法往往缺乏可解释性,提供的解释有限。本研究提出一种基于逻辑正则化的方法,用于超出情境检测,称为LOGRAN(LOGic Regularization for out-of-context ANalysis)。LOGRAN的主要目标是在短语层面分解超出情境检测。通过为短语层面的预测引入隐变量,最终对图像-标题对的预测可使用逻辑规则进行聚合。这些隐变量还提供了最终结果推导的解释,使该基于细粒度检测方法具备内在的解释性。我们在NewsCLIPpings数据集上评估了LOGRAN的性能,结果显示其整体表现具有竞争力。可视化示例也揭示了超出情境图像的可靠短语层面预测,并伴随解释说明。这凸显了我们方法在解决超出情境检测问题方面的有效性以及提升可解释性的作用。

关键词

引用

@article{arxiv.2406.04756,
  title  = {Interpretable Multimodal Out-of-context Detection with Soft Logic Regularization},
  author = {Huanhuan Ma and Jinghao Zhang and Qiang Liu and Shu Wu and Liang Wang},
  journal= {arXiv preprint arXiv:2406.04756},
  year   = {2024}
}

备注

ICASSP 2024 lecture paper