面向视觉 Transformer 的旋转位置编码
计算机视觉与模式识别
2024-07-17 v2 机器学习
摘要
旋转位置编码 (RoPE) 在语言模型中表现出色,尤其在 Transformer 的长度外推方面。然而,RoPE 对计算机视觉领域的影响尚未充分探讨,尽管 RoPE 似乎能够以类似语言领域的方式提升视觉 Transformer (ViT) 的性能。本研究对将 RoPE 应用于 ViT 进行了全面分析,采用针对 2D 视觉数据实用实现的 RoPE。分析结果表明,RoPE 在外推方面表现突出,即在推理时保持精度的同时增加图像分辨率。这一技术最终导致了在 ImageNet-1k、COCO 检测和 ADE-20k 分割任务上的性能提升。我们认为本研究为将 RoPE 应用于 ViT 提供了详尽的指导方针,仅需最小的额外计算开销即可提升 backbone 的性能。我们的代码和预训练模型已提供于 https://github.com/naver-ai/rope-vit。
引用
@article{arxiv.2403.13298,
title = {Rotary Position Embedding for Vision Transformer},
author = {Byeongho Heo and Song Park and Dongyoon Han and Sangdoo Yun},
journal= {arXiv preprint arXiv:2403.13298},
year = {2024}
}
备注
Accepted to ECCV 2024