中文

基于 2D 引导与几何细化的任务感知 3D 动作分割

计算机视觉与模式识别 2025-11-18 v1 人工智能 图像与视频处理

摘要

从自然语言指令中理解 3D 场景级动作对于启用机器人在复杂环境中进行有意义的交互至关重要。然而,这一任务仍具有挑战性,due to需要进行语义推理和空间定位。现有方法主要关注对象级动作,或仅将 2D 预测提升至 3D,忽略点云中丰富的几何结构信息且计算成本高。为此,我们引入一种名为 Task-Aware 3D Scene-level Affordance segmentation (TASA) 的几何优化框架,通过粗到细的方式联合利用 2D 语义线索和 3D 几何推理。为提高动作检测效率,TASA 包含一个 task-aware 2D 动作检测模块,从语言和视觉输入中识别可操作点,指导选择 task-relevant 视图。为充分利用 3D 几何信息,提出一个 3D 动作细化模块,将 2D 语义先验与局部 3D 几何集成, resulting in accurate and spatially coherent 3D affordance masks。在 SceneFun3D 上的实验表明,TASA 在场景级动作分割的准确性和效率方面均显著优于基线方法。

关键词

引用

@article{arxiv.2511.11702,
  title  = {Task-Aware 3D Affordance Segmentation via 2D Guidance and Geometric Refinement},
  author = {Lian He and Meng Liu and Qilang Ye and Yu Zhou and Xiang Deng and Gangyi Ding},
  journal= {arXiv preprint arXiv:2511.11702},
  year   = {2025}
}