PLAF:面向高效 3D 场景理解的像素级语言对齐特征提取
计算机视觉与模式识别
2026-04-24 v2 机器人学
摘要
准确的开放词汇 3D 场景理解需要语义表示在像素层面上同时具备语言对齐性和空间精确性,并且在拓展到 3D 空间时保持可扩展性。然而,现有表征难以同时满足这些要求,密集地将像素级语义传递到 3D 常导致显著冗余,造成大规模场景中的存储和查询效率低下。为此,我们提出 \emph{PLAF},即 Pixel-wise Language-Aligned Feature extraction框架,使其在不牺牲开放词汇表达力的前提下,在 2D 中实现稠密且准确的语义对齐。基于此表征,我们进一步设计了高效的语义存储和查询方案,显著减少 2D 和 3D 域中的冗余。实验结果表明,\emph{PLAF} 为准确且高效的开放词汇 3D 场景理解提供了有力的语义基础。代码已公开于 https://github.com/RockWenJJ/PLAF。
引用
@article{arxiv.2604.15770,
title = {PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding},
author = {Junjie Wen and Junlin He and Fei Ma and Jinqiang Cui},
journal= {arXiv preprint arXiv:2604.15770},
year = {2026}
}
备注
Accepted by ICCA 2026