几何遇见视觉:在蒸馏场中重访预训练语义
计算机视觉与模式识别
2025-10-06 v1 机器人学
摘要
语义蒸馏在辐射场中推动了开放词汇机器人策略(例如在操控和导航中)取得了显著进展,这些策略建立在来自大型视觉模型的预训练语义之上。虽然先前的工作已展示了视觉唯一语义特征(例如 DINO 和 CLIP)在高斯光点和神经辐射场中的有效性,但几何锚定在蒸馏场中的潜在优势仍是一个开放问题。从原理上说,视觉-几何特征似乎对空间任务(如姿态估计)非常有前景,这促使我们提出:在蒸馏场中,是否具有几何锚定语义特征能带来优势?具体地,我们提出了三个关键问题:首先,是否产生更高保真度的几何感知语义特征?我们发现,来自几何锚定背板的图像特征包含比其对应特征更细致的结构细节。其次,是否改善语义目标定位?我们观察到在此任务中没有显著差异。最后,是否实现更高精度的辐射场反向投影?鉴于先前工作的局限性以及它们缺乏语义集成,我们提出了一种新框架 SPINE,用于无初始估计的反向投影辐射场,包含两个核心组件:使用蒸馏语义进行粗反向投影,以及基于光度的优化进行细反向投影。令人惊讶的是,我们发现几何锚定特征的姿态估计精度会随之下降。我们的结果表明,视觉唯一特征在更广泛的下游任务中具有更大的灵活性,尽管几何锚定特征包含更多几何细节。值得注意的是,我们的发现凸显了未来研究对有效几何锚定策略的必要性,这些策略能够增强预训练语义特征的灵活性和性能。
引用
@article{arxiv.2510.03104,
title = {Geometry Meets Vision: Revisiting Pretrained Semantics in Distilled Fields},
author = {Zhiting Mei and Ola Shorinwa and Anirudha Majumdar},
journal= {arXiv preprint arXiv:2510.03104},
year = {2025}
}