TReF-6:从单次演示推断任务相关坐标系以实现单样本技能泛化
机器人学
2025-09-30 v2 人工智能
摘要
机器人由于缺乏可迁移且可解释的空间表示,常常难以从单次演示中进行泛化。在本工作中,我们引入TReF-6,该方法从单个轨迹推断出简化的、抽象的6DoF任务相关坐标系。我们的方法仅从轨迹几何中识别影响点,以定义局部坐标系的原点,作为动态移动原语(DMP)参数化的参考。该影响点捕获任务的空间结构,将标准DMP公式扩展到开始-目标仿造之外。通过视觉语言模型对推断坐标系进行语义 grounding,并通过Grounded-SAM在新场景中进行定位,实现功能一致的技能泛化。我们在仿真中验证了TReF-6的鲁棒性,能够抵抗轨迹噪声。我们进一步在实际环境中部署了端到端管道,展示了TReF-6支持在多样化物体配置下保持任务意图的单样本仿射学习。
引用
@article{arxiv.2509.00310,
title = {TReF-6: Inferring Task-Relevant Frames from a Single Demonstration for One-Shot Skill Generalization},
author = {Yuxuan Ding and Shuangge Wang and Tesca Fitzgerald},
journal= {arXiv preprint arXiv:2509.00310},
year = {2025}
}