中文

DeLTa:演示与语言引导的新型透明物体操控

机器人学 2026-02-25 v2 计算机视觉与模式识别

摘要

尽管透明物体交互在日常生活中广为人知,但透明机器人操控研究仍局限于短时序任务和基础抓取能力。虽然某些方法部分解决了这些问题,但大多数方法在对新物体的泛化性方面存在局限,且不足以实现精确的长时序机器人操控。为此,我们提出了 DeLTa(Demonstration and Language-Guided Novel Transparent Object Manipulation),一种集成深度估计、6D 位姿估计和视觉语言规划的新型框架,用于由自然语言任务指令引导的精确长时序透明物体操控。我们方法的关键优势在于其单演示方法,可无需类别级先验或额外训练地将 6D 轨迹推广到新型透明物体。此外,我们提出了一个任务规划器,用于细化 VLM 生成的计划,以考虑单臂、眼在手机器人进行长时序物体操控任务的约束。通过全面评估,我们证明该方法在透明物体操控方面显著优于现有方法,尤其是在需要精确操控能力的长时序情景中。项目页面:https://sites.google.com/view/DeLTa25/

关键词

引用

@article{arxiv.2510.05662,
  title  = {DeLTa: Demonstration and Language-Guided Novel Transparent Object Manipulation},
  author = {Taeyeop Lee and Gyuree Kang and Bowen Wen and Youngho Kim and Seunghyeok Back and In So Kweon and David Hyunchul Shim and Kuk-Jin Yoon},
  journal= {arXiv preprint arXiv:2510.05662},
  year   = {2026}
}

备注

Project page: https://sites.google.com/view/DeLTa25/