中文

ID-Align:面向视觉语言模型动态高分辨率适配的 RoPE 感知位置重映射

计算机视觉与模式识别 2025-05-28 v1 计算与语言

摘要

目前,提升视觉语言模型性能的一种普遍方法是同时编码图像的高分辨率版本和缩略图。虽然有效,但该方法会生成大量图像 token。当与广泛使用的旋转位置编码结合时,其长程衰减特性阻碍了高分辨率 token 与缩略图 token 之间以及文本与图像之间的交互。为了解决这些问题,我们提出了 ID-Align,通过重新排序位置 ID 来缓解这些问题。在该方法中,高分辨率 token 继承其对应缩略图 token 的 ID,同时约束位置索引的过度扩张。我们在 LLaVA-Next 框架内进行的实验表明,ID-Align 取得了显著提升,包括在 MMBench 的关系推理任务上提高了 6.09%,并在多个基准测试上获得了显著增益。我们的代码可在以下链接获取:https://github.com/zooblastlbz/ID-Align。

关键词

引用

@article{arxiv.2505.21465,
  title  = {ID-Align: RoPE-Conscious Position Remapping for Dynamic High-Resolution Adaptation in Vision-Language Models},
  author = {Bozhou Li and Wentao Zhang},
  journal= {arXiv preprint arXiv:2505.21465},
  year   = {2025}
}