中文

VideoRoPE:什么造就了好的视频旋转位置嵌入?

计算机视觉与模式识别 2025-06-02 v3

摘要

虽然旋转位置嵌入(Rotary Position Embedding, RoPE)及其变体因其长上下文能力而被广泛采用,但将一维 RoPE 扩展到具有复杂时空结构的视频仍然是一个开放的挑战。这项工作首先引入了一项全面的分析,确定了有效将 RoPE 适配到视频所必需的四个关键特性,这些特性在先前的工作中尚未被充分考虑。作为我们分析的一部分,我们引入了一个具有挑战性的 V-NIAH-D(带干扰项的视觉大海捞针)任务,该任务向 V-NIAH 中添加了周期性干扰项。V-NIAH-D 任务表明,先前的 RoPE 变体由于缺乏适当的时间维度分配,很容易被干扰项误导。基于我们的分析,我们引入了 VideoRoPE,它具有一个旨在保持时空关系的 3D 结构。VideoRoPE 具有低频时间分配以减轻周期性振荡,对角布局以保持空间对称性,以及可调时间间隔以解耦时间和空间索引。VideoRoPE 在长视频检索、视频理解和视频幻觉等多种下游任务中,始终超越先前的 RoPE 变体。我们的代码将开源在 https://github.com/Wiselnn570/VideoRoPE。

关键词

引用

@article{arxiv.2502.05173,
  title  = {VideoRoPE: What Makes for Good Video Rotary Position Embedding?},
  author = {Xilin Wei and Xiaoran Liu and Yuhang Zang and Xiaoyi Dong and Pan Zhang and Yuhang Cao and Jian Tong and Haodong Duan and Qipeng Guo and Jiaqi Wang and Xipeng Qiu and Dahua Lin},
  journal= {arXiv preprint arXiv:2502.05173},
  year   = {2025}
}