中文

SKT:将状态感知关键点轨迹集成到视觉语言模型以实现机器人服装操控

机器人学 2024-10-08 v2 人工智能 计算机视觉与模式识别

摘要

自动化服装操控是助助式机器人面临的重大挑战,因为服装具有多样且可变形的特性。传统方法通常需要为每种服装类型构建独立模型,限制了其可扩展性和适应性。相比之下,本文提出了一种统一方法,利用视觉语言模型(VLM)提高跨各种服装类别的关键点预测。通过解释视觉与语义信息,Our model 使机器人能够使用单个模型管理不同服装状态。我们采用先进的仿真技术创建了大规模合成数据集,实现了无需大量真实数据的可扩展训练。实验结果表明,基于 VLM 的方法显著提高了关键点检测准确度和任务成功率,为机器人服装操控提供了更灵活、通用的解决方案。此外,本研究还凸显了 VLM 整合各种服装操控任务于单一框架的潜力,为未来在家庭自动化和助助式机器人领域的广泛应用铺平了道路。

关键词

引用

@article{arxiv.2409.18082,
  title  = {SKT: Integrating State-Aware Keypoint Trajectories with Vision-Language Models for Robotic Garment Manipulation},
  author = {Xin Li and Siyuan Huang and Qiaojun Yu and Zhengkai Jiang and Ce Hao and Yimeng Zhu and Hongsheng Li and Peng Gao and Cewu Lu},
  journal= {arXiv preprint arXiv:2409.18082},
  year   = {2024}
}