中文

回忆为时已晚:解释多模态知识检索中的两跳问题

机器学习 2025-12-04 v1

摘要

训练视觉语言模型(VLMs)旨在将视觉编码器的视觉表示与预训练大语言模型(LLM)的文本表示对齐。然而,许多VLMs的事实回忆性能相比其LLM骨干模型有所下降,这引发了多模态微调在将LLM中现有机制扩展到视觉输入方面有多有效的疑问。我们认为,基于视觉输入的事实回忆需要VLMs解决一个两跳问题:(1)从视觉输入形成实体表示,(2)基于这些实体表示回忆相关事实知识。通过对14种不同架构(LLaVA、Native、Cross-Attention)、规模(7B-124B参数)和训练设置的VLMs在事实回忆任务上与其原始LLM骨干模型进行基准测试,我们发现14个模型中有11个表现出事实回忆退化。我们选择了三个高性能退化和两个低性能退化的模型,并使用归因修补、激活修补和探测来表明,退化的VLMs难以利用其LLM骨干模型中现有的事实回忆电路,因为它们在计算过程中过晚地解决了第一跳。相比之下,高性能VLMs足够早地解决实体表示,从而复用现有的事实回忆机制。最后,我们展示了两种恢复性能的方法:将LLM骨干模型中的实体表示修补到VLM中,以及使用思维链推理进行提示。我们的结果表明,早期实体解析的速度关键性地决定了VLMs利用预存LLM机制的有效性。更广泛地说,我们的工作展示了机制分析如何解释和揭示多模态对齐中的系统性失败。

关键词

引用

@article{arxiv.2512.03276,
  title  = {Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval},
  author = {Constantin Venhoff and Ashkan Khakzar and Sonia Joseph and Philip Torr and Neel Nanda},
  journal= {arXiv preprint arXiv:2512.03276},
  year   = {2025}
}