中文

HoPE:长上下文视觉语言模型的混合位置嵌入

机器学习 2025-10-09 v2 计算机视觉与模式识别

摘要

视觉语言模型(VLMs)在多模态任务中取得了显著进展。然而,它们在长上下文场景中的性能经常下降,尤其是长视频。虽然旋转位置嵌入(RoPE)已被广泛用于大型语言模型(LLMs)的长度泛化,但将 vanilla RoPE 扩展以捕捉视频中的复杂时空依赖关系仍然是一个未解决的挑战。现有方法通常通过在 RoPE 内分配不同频率来编码三维位置信息。然而,这些分配策略主要依赖启发式方法,缺乏深入的理论分析。在本文中,我们首先研究了不同分配策略如何影响 VLMs 的长上下文能力。我们的分析表明,现有的多模态 RoPE 无法可靠地捕捉 extended contexts 中的语义相似性。为了解决这个问题,我们提出了 HoPE,一种混合位置嵌入,旨在改善 VLMs 的长上下文能力。HoPE 引入了一种混合频率分配策略,用于在任意长上下文中进行可靠的语义建模,以及一种动态时间缩放机制,以促进跨不同上下文长度的稳健学习和灵活推理。在四个视频基准上的广泛实验,涵盖长视频理解和检索任务,表明 HoPE 一致优于现有方法,证实了其有效性。我们的代码可在 https://github.com/hrlics/HoPE 获取。

关键词

引用

@article{arxiv.2505.20444,
  title  = {HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models},
  author = {Haoran Li and Yingjie Qin and Baoyuan Ou and Lai Xu and Ruiwen Xu},
  journal= {arXiv preprint arXiv:2505.20444},
  year   = {2025}
}

备注

NeurIPS 2025