GIBLy:通过无架构轻量几何归纳偏置层提高3D语义分割
计算机视觉与模式识别
2026-05-26 v1 人工智能
机器学习
摘要
在3D场景理解中,深度学习模型依赖大型模型和大量训练数据来捕捉3D数据中存在的基本几何结构。然而,现有方法缺乏显式机制来整合诸如可学习原始形状等几何信息,往往需要更大的模型和更多训练数据,从而增加成本并可能限制泛化能力。我们引入GIBLy,这是一个轻量级几何归纳偏置层,将可学习的几何先验整合到3D分割管道中。GIBLy通过提供与简单几何形状(因此具有人类可解释性)对齐的特征来增强现有架构——无论是基于MLP、卷积还是基于Transformer的架构——以提高分割性能,同时几乎没有增加计算开销。我们在多个3D语义分割基准数据集上验证了该方法,展示了一致的性能提升,包括在PTV3上对TS40K实现了最高+11.5%的mIoU增长,仅增加58K个额外参数。我们的结果突显了通过显式编码几何结构来支持准确且高效的3D场景理解的优势,以及这种轻量级添加层的作用。
引用
@article{arxiv.2605.24243,
title = {GIBLy: Improving 3D Semantic Segmentation through an Architecture-Agnostic Lightweight Geometric Inductive Bias Layer},
author = {Diogo Lavado and Alessandra Micheletti and Clàudia Soares},
journal= {arXiv preprint arXiv:2605.24243},
year = {2026}
}