SeqAffordSplat:基于 3D 高斯溅写的场景级顺序可 affordance 推理
计算机视觉与模式识别
2025-08-01 v1
摘要
3D 可 affordance 推理,即将人类指令与 3D 物体功能区域关联起来的任务,是具身智能体不可或缺的能力。当前基于 3D 高斯溅写 (3DGS) 的方法在本质上仅限于单物体、单步骤交互,这种范式不足以应对复杂真实场景所需的长期、多物体任务。为弥合这一差距,我们提出了 3D 高斯溅写顺序可 affordance 推理的新任务,并构建 SeqAffordSplat,一个规模庞大的基准数据集,包含 1800 多个场景,以支持复杂 3DGS 环境下长期可 affordance 理解的研究。随后,我们提出了 SeqSplatNet,一个端到端的框架,直接将指令映射到一序列 3D 可 affordance 掩码。SeqSplatNet 采用大型语言模型,按序生成包含特殊分割标记的文本,指导条件解码器生成相应的 3D 掩码。为处理复杂场景几何结构,我们引入一种预训练策略——条件几何重建,该模型学习从已知几何观察中重建完整的可 affordance 区域掩码,从而构建稳健的几何先验。此外,为解决语义歧义,我们设计了特征注入机制,将来自 2D 视觉基础模型 (VFM) 的丰富语义特征提升到 3D 解码器中,并在多个尺度上进行融合。大量实验表明,我们的方法在该具挑战性的基准上取得了新的最佳结果,有效地将可 affordance 推理从单步骤交互推进到场景层面的复杂、顺序任务。
引用
@article{arxiv.2507.23772,
title = {SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting},
author = {Di Li and Jie Feng and Jiahao Chen and Weisheng Dong and Guanbin Li and Yuhui Zheng and Mingtao Feng and Guangming Shi},
journal= {arXiv preprint arXiv:2507.23772},
year = {2025}
}