GEAL:基于跨模态一致性的通用 3D 功能学习
计算机视觉与模式识别
2024-12-13 v1
摘要
从语义线索识别 3D 物体上功能区域是机器人和人机交互中的关键任务。然而,现有的 3D 功能学习方法由于标注数据有限以及依赖于专注于几何编码的 3D 主干网络,难以在现实世界噪声和数据损坏下实现良好的泛化和鲁棒性。我们提出 GEAL(Generalizable 3D Affordance Learning),是一种新型框架,旨在通过利用大规模预训练的 2D 模型来增强 3D 功能学习的泛化性和鲁棒性。我们采用双分支架构,结合高斯溅写 (Gaussian splatting) 方法,在 3D 点云和 2D 表示之间建立一致映射,实现从稀疏点云生成真实的 2D 渲染。 Granularity-adaptive fusion 模块和 2D-3D 一致性对齐模块进一步加强了跨模态对齐和知识迁移,使 3D 分支能够从 2D 模型中受益,从而获得丰富的语义和强大的泛化能力。为全面评估鲁棒性,我们引入了两个新的基于损坏的数据集:PIAD-C 和 LASO-C。在公开数据集和我们的数据集上进行的大量实验表明,GEAL 在各种条件下均显著优于现有方法,展现出在见识和新颖目标类别以及受损数据上的鲁棒且可适应的功能预测能力。代码和数据集已公开。
引用
@article{arxiv.2412.09511,
title = {GEAL: Generalizable 3D Affordance Learning with Cross-Modal Consistency},
author = {Dongyue Lu and Lingdong Kong and Tianxin Huang and Gim Hee Lee},
journal= {arXiv preprint arXiv:2412.09511},
year = {2024}
}
备注
22 pages, 8 figures, 12 tables; Project Page at https://dylanorange.github.io/projects/geal