言外之意:检测并纠正多模态新闻预览中的误导性遗漏
计算机视觉与模式识别
2026-04-24 v3 社会与信息网络
摘要
即使事实正确,社交媒体新闻预览(图像-标题对)也可能引发解读漂移:通过选择性地遗漏关键上下文,它们导致读者形成与全文支持的观点相背离的判断。这种隐蔽的危害比显性错误信息更微妙,但尚未得到充分探索。为填补这一空白,我们开发了一个多阶段流水线,模拟基于预览和基于上下文的理解,从而构建了 MM-Misleading 基准。利用 MM-Misleading,我们系统地评估了开源大型视觉语言模型(LVLMs),并揭示了其在基于遗漏的误导性检测方面的显著盲点。我们进一步提出了 OMGuard,它结合了(1)用于误导性检测的解读感知微调,以及(2)理由引导的误导性内容纠正,其中显式理由指导标题重写以减少误导印象。实验表明,OMGuard 将一个 8B 模型的检测准确率提升至 235B LVLM 的水平,同时提供了显著更强的端到端纠正能力。进一步分析表明,误导性通常源于局部叙事偏移,例如背景缺失,而非全局框架变化,并识别出仅靠文本纠正失败的图像驱动案例,强调了视觉干预的必要性。
引用
@article{arxiv.2601.05563,
title = {What's Left Unsaid? Detecting and Correcting Misleading Omissions in Multimodal News Previews},
author = {Fanxiao Li and Jiaying Wu and Tingchao Fu and Dayang Li and Herun Wan and Wei Zhou and Min-Yen Kan},
journal= {arXiv preprint arXiv:2601.05563},
year = {2026}
}