推理层层嵌入:通过层选择性合并恢复视频语言模型的时间推理
计算机视觉与模式识别
2026-04-14 v1 计算与语言
摘要
多模态适应为大型语言模型(LLM)提供了感知能力,但往往削弱了源自语言预训练所继承的推理能力。这一权衡在视频语言模型(VLM)中尤为突出,因为视觉对齐可能损害对序列事件的时间推理(TR)。我们提出 MERIT,一个无训练、以任务为导向的模型合并框架,用于恢复 VLM 中的 TR。MERIT 在 VLM 与其配对文本-only 主干模型之间进行层级自注意力合并搜索,目标函数旨在提高 TR 同时惩罚时间感知(TP)的退化。在三个具有代表性的 VLM 和多个具有挑战性的视频基准测试中,MERIT 均一致改善了 TR,保持或提升了 TP,并能泛化到四个不同的基准测试中。它还优于统一的全模型合并和随机层选择,表明有效恢复取决于选择正确的层。干预性遮蔽和帧级归因进一步表明,所选层在推理中占据不成比例的重要作用,并将模型决策引向时间上和因果上相关的证据。这些结果表明,面向感知的、具有目标性的模型合并可有效恢复 VLM 中的 TR,而无需重新训练。
引用
@article{arxiv.2604.11399,
title = {Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging},
author = {Zihang Fu and Haonan Wang and Jian Kang and Kenji Kawaguchi and Jiaying Wu},
journal= {arXiv preprint arXiv:2604.11399},
year = {2026}
}