视觉-语言模型如何处理跨模态的冲突信息?
计算与语言
2025-07-03 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
AI 模型越来越需要多模态,将不同输入流整合为可基于后续行为和动作的连贯状态表示。本文旨在理解此类模型在输入流呈现冲突信息时的行为表现。具体聚焦视觉-语言模型,我们提供不一致的输入(例如,一张狗的图片搭配标题为“一张猫的照片”),并询问模型报告特定模态中所包含信息(例如:“标题说了什么/图片中有什么?”)。我们发现,模型往往倾向于一种模态,例如无论标题说什么,都报告图片内容,但不同模型在倾向的模态上存在差异。我们发现,行为上偏好的模态在模型的内部表征结构中得以体现,并且特定的注意力头可以重构表征以偏好某一种模态。此外,我们发现模态无关的“路由头”似乎会促进关于所请求模态的答案,并可被操控或迁移以提高跨数据集和模态的性能。总体而言,本工作为识别和控制模型在复杂多模态环境中检测和解决冲突信号的可能性提供了关键步骤。
引用
@article{arxiv.2507.01790,
title = {How Do Vision-Language Models Process Conflicting Information Across Modalities?},
author = {Tianze Hua and Tian Yun and Ellie Pavlick},
journal= {arXiv preprint arXiv:2507.01790},
year = {2025}
}
备注
All code and resources are available at: https://github.com/ethahtz/vlm_conflicting_info_processing