中文

PAS:视频 LLM 中时序编码的无训练稳定器

计算机视觉与模式识别 2026-03-17 v2 人工智能

摘要

视频 LLM 存在时序不一致性:微小的帧时间位移会翻转注意力并抑制相关帧。我们追溯到这种不稳定性的根源在于将旋转位置嵌入(Rotary Position Embeddings)常规扩展到视频上的做法,即通过多模态 RoPE 实现。该方法诱导的逆傅里叶时序核呈现帧尺度的波纹,这些波纹会以不同的因子放大相邻帧,从而扰乱本应由原始查询键内积决定的注意力。我们提出了相位聚合平滑(Phase Aggregated Smoothing, PAS),一种简单且无训练的机制,通过在不同注意力头之间施加小幅反向相位偏移并聚合其输出来实现稳定。PAS 保留了每个注意力头的谱幅,同时通过聚合有效平滑了时序核,降低了对相位的敏感性,而无需改变位置编码结构。我们的分析表明,RoPE 旋转逻辑可以近似为内容点积按时间核函数比例缩放;平滑该核函数可实现对小时序位移的 Lipschitz 稳定性;多相位平均可在尼采森有效抽样的前提下,削弱高频波纹同时保留每个注意力头的谱谱。实验在多项视频理解基准上进行,在匹配的 token 预算下均表现出一致的改进,且计算开销几乎可忽略不计。PAS 为视频 LLM 的稳健时序编码提供即插即用的升级方案。

关键词

引用

@article{arxiv.2511.10979,
  title  = {PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs},
  author = {Bowen Sun and Yujun Cai and Ming-Hsuan Yang and Hang Wu and Yiwei Wang},
  journal= {arXiv preprint arXiv:2511.10979},
  year   = {2026}
}