中文

基于向量量化特征场的快速3D语义提升

计算机视觉与模式识别 2025-03-11 v1

摘要

我们将提升推广为语义提升,通过纳入指示提升任务相关像素的 per-view 掩码。这些掩码通过查询对应的多尺度像素对齐特征图来确定,而这些特征图源自场景表示,如提炼特征场和特征点云。然而,对提炼特征场渲染的 per-view 特征图存储不可行,特征点云也昂贵且查询成本高。为实现对像素对齐相关掩码的轻量级按需检索,我们引入了向量量化特征场(Vector-Quantized Feature Field)。我们在复杂的室内和室外场景上证明了向量量化特征场的有效性。语义提升配合向量量化特征场,可在场景表示和具身智能领域解锁大量应用。具体而言,我们展示了该方法如何实现文本驱动的局部场景编辑,以及显著提升具身问答任务的效率。

关键词

引用

@article{arxiv.2503.06469,
  title  = {Vector Quantized Feature Fields for Fast 3D Semantic Lifting},
  author = {George Tang and Aditya Agarwal and Weiqiao Han and Trevor Darrell and Yutong Bai},
  journal= {arXiv preprint arXiv:2503.06469},
  year   = {2025}
}