中文

3D-TAFS:一种免训练的 3D 可供性分割框架

机器人学 2025-04-08 v5

摘要

将高级语言指令转化为物理世界中精确的机器人动作仍然具有挑战性,特别是在考虑与 3D 物体交互的可行性时。在本文中,我们介绍了 3D-TAFS,一种用于 3D 可供性分割的新型免训练多模态框架。为了促进对此类框架的全面评估,我们提出了 IndoorAfford-Bench,这是一个包含 9,248 张图像的大规模基准,涵盖 6 个区域的 20 个不同室内场景,支持标准化交互查询。具体而言,我们的框架将大型多模态模型与专门的 3D 视觉网络相结合,实现了 2D 和 3D 视觉理解与语言理解的无缝融合。在 IndoorAfford-Bench 上的大量实验验证了所提出的 3D-TAFS 在处理不同设置下的交互式 3D 可供性分割任务的能力,展示了在各项指标上的竞争性表现。我们的结果突显了 3D-TAFS 在复杂室内环境中基于可供性理解增强人机交互的潜力,推动了面向真实世界应用的更直观、更高效的机器人框架的发展。

关键词

引用

@article{arxiv.2409.10078,
  title  = {3D-TAFS: A Training-free Framework for 3D Affordance Segmentation},
  author = {Meng Chu and Xuan Zhang and Zhedong Zheng and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2409.10078},
  year   = {2025}
}