FishRoPE:用于全向视觉感知的投影式旋转位置编码
计算机视觉与模式识别
2026-04-14 v1 人工智能
摘要
视觉基础模型(VFM)和鸟瞰图(BEV)表示已显著推进了视觉感知,然而其内部空间表示假设了针孔相机的直线几何。鱼眼相机因其环视覆盖范围而广泛部署于量产自动驾驶车辆上,但其表现出严重的径向畸变,使得这些表示在几何上不一致。同时,大规模鱼眼标注的稀缺使得从头开始重新训练基础模型不切实际。我们提出FishRoPE,一个轻量级框架,通过两个组件将冻结的VFM适配到鱼眼几何:一个带有低秩适配(LoRA)的冻结DINOv2骨干网络,无需特定任务预训练即可将丰富的自监督特征迁移到鱼眼;以及鱼眼旋转位置编码(FishRoPE),它在鱼眼投影的球坐标中重新参数化注意力机制,使得自注意力和交叉注意力都基于角度间隔而非像素距离进行操作。FishRoPE与架构无关,引入的计算开销可忽略不计,并且在针孔几何下自然退化为标准形式。我们在WoodScape 2D检测(54.3 mAP)和SynWoodScapes BEV分割(65.1 mIoU)上评估了FishRoPE,在两个基准测试中都取得了最先进的结果。
引用
@article{arxiv.2604.10391,
title = {FishRoPE: Projective Rotary Position Embeddings for Omnidirectional Visual Perception},
author = {Rahul Ahuja and Mudit Jain and Bala Murali Manoghar Sai Sudhakar and Venkatraman Narayanan and Pratik Likhar and Varun Ravi Kumar and Senthil Yogamani},
journal= {arXiv preprint arXiv:2604.10391},
year = {2026}
}