SeqAfford:基于多模态大语言模型的顺序 3D 功能推理
计算机视觉与模式识别
2025-03-24 v3 人工智能
摘要
3D 功能分割旨在将人类指令链接到可触摸的 3D 物体区域,以实现具身操作。现有方法通常遵循单对象、单功能范式,即每种功能类型或明确指令严格对应特定功能区域,无法处理长期任务。这种范式无法主动推理关于复杂用户意图的推理,这些意图常暗示顺序功能。在本文中,我们引入了顺序 3D 功能推理任务,通过推理琐碎的用户意图并将其分解为一系列分割图来扩展传统范式。为此,我们构建了首个基于指令的功能分割基准,涵盖单功能与顺序功能推理,包含 18 万条指令点云对。基于该基准,我们提出的模型 SeqAfford 能够激活 3D 多模态大语言模型,赋予其额外的功能分割能力,确保在统一框架中进行世界知识推理和细粒度功能定位。我们进一步引入多层次语言-点集成模块,以实现 3D 密集预测。广泛的实验评估表明,我们的模型在众多既定方法上均表现出色,并展现出开放世界泛化能力及顺序推理能力。
引用
@article{arxiv.2412.01550,
title = {SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model},
author = {Chunlin Yu and Hanqing Wang and Ye Shi and Haoyang Luo and Sibei Yang and Jingyi Yu and Jingya Wang},
journal= {arXiv preprint arXiv:2412.01550},
year = {2025}
}