思维链预测控制
机器学习
2024-07-09 v2 人工智能
机器人学
摘要
我们研究从演示中进行复杂底层控制的泛化策略学习(例如,富含接触的物体操控)。我们提出一种利用次优演示的新型分层模仿学习方法。首先,我们提出一种与观测空间无关的方法,以无监督方式高效发现演示的多步子技能分解。通过将时间上接近且功能相似的动作分组为子技能级演示段,段边界处的观测构成了任务的规划步骤链,我们称之为思维链(CoT)。接下来,我们提出一种基于 Transformer 的设计,有效学习预测 CoT 作为子技能级指导。我们通过可学习的提示 token 和混合掩码策略将动作与子技能预测相耦合,从而在测试时实现动态更新的指导,并改善轨迹的特征表示以用于泛化策略学习。我们的方法,即思维链预测控制(CoTPC),在具有次优演示的极具挑战性的操控任务上持续超越现有的强基线。
引用
@article{arxiv.2304.00776,
title = {Chain-of-Thought Predictive Control},
author = {Zhiwei Jia and Vineet Thumuluri and Fangchen Liu and Linghao Chen and Zhiao Huang and Hao Su},
journal= {arXiv preprint arXiv:2304.00776},
year = {2024}
}
备注
ICML 2024; project page at https://sites.google.com/view/cotpc