重审视视觉-语言模型中的多模态位置编码
计算机视觉与模式识别
2026-04-07 v3
摘要
多模态位置编码是视觉-语言模型的关键要素,但目前几乎没有系统性地研究多模态位置编码。我们对多模态旋转位置编码(RoPE)进行了全面分析,通过检视其两个核心组成部分:位置设计和频率分配。通过大量实验,我们识别出三项关键指导原则:位置一致性、频率完全利用以及保持文本先验——确保无歧义的布局、丰富的表示以及来自预训练LLM的忠实迁移。基于这些见解,我们提出了Multi-Head RoPE(MHRoPE)和MRoPE-Interleave(MRoPE-I),两种简单且即插即用的数据变体,无需架构更改。我们的方法在多样化基准测试上均显著优于现有方法,在一般和细粒度的多模态理解方面都取得了显著的改进。代码将在 https://github.com/JJJYmmm/Multimodal-RoPEs 公开。
引用
@article{arxiv.2510.23095,
title = {Revisiting Multimodal Positional Encoding in Vision-Language Models},
author = {Jie Huang and Xuejing Liu and Sibo Song and Ruibing Hou and Hong Chang and Junyang Lin and Shuai Bai},
journal= {arXiv preprint arXiv:2510.23095},
year = {2026}
}
备注
16 pages