ContextGuard-LVLM:通过细粒度跨模态情境一致性验证提升新闻可信度
计算机视觉与模式识别
2025-08-12 v1
摘要
数字新闻媒体的不断扩散 necessitates 鲁棒的内容真实性验证方法,尤其是关注视觉与文本信息之间的一致性。传统方法往往不足以解决细粒度跨模态情境一致性 (FCCC) 的问题,这一问题涵盖了视觉叙事、情感基调以及背景信息与文本的更深层对齐,超越简单的实体匹配。为此,我们提出 ContextGuard-LVLM,一个基于先进视觉语言大模型 (LVLMs) 构建的新框架,集成多阶段情境推理机制。我们的模型通过强化或对抗学习范式获得独特增强,使其能够检测那些遮掩于零样本基线的细微情境不一致。我们扩展并增强了三个既有数据集 (TamperedNews-Ent、News400-Ent、MMG-Ent),包括“情境情感”、“视觉叙事主题”和“场景-事件逻辑一致性”等细粒度情境注释,引入了全新的 CTXT (Contextual Coherence) 实体类型。广泛的实验表明,ContextGuard-LVLM 在 nearly all细粒度一致性任务中均优于领先的零样本 LVLMs 基线 (InstructBLIP 和 LLaVA 1.5),在复杂逻辑推理和细微情境理解方面实现显著提升。此外,我们的模型对细微扰动具有更好的鲁棒性,在具有挑战性的样本上与人类专家判断的一致性更高,验证了其在辨别复杂情境脱节形式方面的有效性。
引用
@article{arxiv.2508.06623,
title = {ContextGuard-LVLM: Enhancing News Veracity through Fine-grained Cross-modal Contextual Consistency Verification},
author = {Sihan Ma and Qiming Wu and Ruotong Jiang and Frank Burns},
journal= {arXiv preprint arXiv:2508.06623},
year = {2025}
}