曲率感知式描述:利用测地注意力进行3D场景理解
计算机视觉与模式识别
2026-05-12 v1 人工智能
机器学习
摘要
准确的3D场景描述是机器人导航和增强现实的基本任务,但当前的稠密描述方法在处理稀疏点云数据时面临严重限制。现有方法应用欧几里得嵌入空间,难以同时保留细粒度的局部几何细节并建模指数级增长的全局语义层次,导致局部定位不准或场景描述不连贯、浅层。本文提出一种新型 \textbf{\textsc{Curvature-Aware Captioning}} 框架,集成 novel non-Euclidean 测地注意力机制,解决定位-语义化冲突。具体而言,Oblique空间内的自注意力实现维度一致性并建立长程依赖;Lorentz空间内的双向测地交叉注意力跨场景实例建模层次化语义关系,实现物体定位精确度与场景描述连贯性。理论分析表明,Oblique流形与Lorentz双曲面之间的曲率互补解决了欧几里得-双曲冲突,确保通过各向同性优化保持特征稳定性,同时保持固有的层次化关系。在ScanRefer和Nr3D基准上进行大量实验,展示了状态-of-the-art性能,在定位精度和描述丰富性方面均取得显著提升。
引用
@article{arxiv.2605.08808,
title = {Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding},
author = {Ziyao He and Yingjie Liu and ZhangYangRui and Mingsong Chen and Xuan Tang and Xian Wei},
journal= {arXiv preprint arXiv:2605.08808},
year = {2026}
}
备注
CVPR2026 Highlight!