中文

Invaria:通过下一分辨率预测学习点云中的尺度和密度不变性

计算机视觉与模式识别 2026-05-18 v1

摘要

现代图像编码器通过将语义与分辨率解耦来实现高泛化能力,而这种能力在3D领域尚未完全实现。我们研究了3D点云编码器未能实现类似泛化能力的原因,并发现现有模型对采样分辨率和尺度变化高度敏感,导致性能显著下降。这种敏感性是机器人技术实际部署的一个主要瓶颈,因为它表明模型过度拟合于特定的量化密度和物体尺度,而不是学习不变的语义特征。为了减轻这种依赖性,我们提出了Invaria,这是一个通过下一分辨率预测和感受野校准实现尺度和密度不变性的点云编码器。虽然我们的目标不是显式生成高分辨率点云,但我们发现这种训练目标鼓励模型学习鲁棒的结构不变量。由此产生的编码器在分辨率变化期间实现了显著的性能提升,同时通过紧凑的模型尺寸和减少的令牌需求保持了高效率。具体来说,在ScanNet数据集上,Invaria在分辨率降低3倍的情况下实现了56.0%更高的mIoU,在物体尺度缩小3倍的情况下实现了20%的提升。这些增益是在模型尺寸减小45%和输入令牌平均减少40%的情况下实现的。

关键词

引用

@article{arxiv.2605.15923,
  title  = {Invaria: Learning Scale and Density Invariance in Point Clouds via Next-Resolution Prediction},
  author = {Chun-Peng Chang and Shaoxiang Wang and Alain Pagani and Dariu Gavrila and Holger Caesar},
  journal= {arXiv preprint arXiv:2605.15923},
  year   = {2026}
}