中文

VISTA:通过训练-free 动态链式思考路由消除视频-LLM 中的语义惯性

计算机视觉与模式识别 2026-01-08 v3 人工智能

摘要

最近的大语言模型研究成功地转向了系统 2 推理,但将这些范式应用于视频理解仍具有挑战性。尽管现有研究将视频-LLM 的失败归因于感知局限,但我们的实证分析揭示了一种称为语义惯性的认知错位,其中模型倾向于抑制有效的视觉证据,而遵从主导的语言先验。为弥补这一不足,我们提出了 VISTA,一个旨在将感知与逻辑推理对齐的训练-free 框架。通过动态路由推理路径并将潜在的视觉特征物化为显式的文本锚点,我们的方法有效地平衡了参数化知识的影响。此外,我们引入了潜在推理共识机制以缓解随机幻觉。VISTA 在广泛的基准测试中表现出色,分别在 Egochema 上优于基础模型 9.3%,在 VideoEspresso 上优于 5.6%,与更大且专有的模型一道,甚至超过。我们的数据代码将很快公开。

关键词

引用

@article{arxiv.2505.11830,
  title  = {VISTA: Mitigating Semantic Inertia in Video-LLMs via Training-Free Dynamic Chain-of-Thought Routing},
  author = {Hongbo Jin and Jiayu Ding and Siyi Xie and Guibo Luo and Ge Li},
  journal= {arXiv preprint arXiv:2505.11830},
  year   = {2026}
}

备注

19 pages, 7 figures