基于过程克隆的思维链模仿
机器学习
2022-05-24 v1 人工智能
摘要
模仿学习旨在从记录下来的专家行为演示中提取高性能策略。通常将模仿学习框定为监督学习问题,即拟合一个函数逼近器到所记录演示所展现的输入-输出映射(输入观测到输出动作)。虽然将模仿学习视为监督式输入-输出学习问题使其在多种设置中具有适用性,但在专家演示能提供对专家行为更丰富洞察的情形下,这也是对该问题过于简化的看法。例如,路径导航、机器人操控和策略游戏等应用通过规划、搜索或其他多步算法获取专家演示,不仅揭示待模仿的输出动作,还揭示如何确定该动作的过程。尽管这些中间计算可能使用智能体在推理时不可用的工具(如环境模拟器),但它们作为解释专家状态到动作映射的方式仍具信息价值。为在不依赖专家执行过程时可能使用的特权工具的情况下恰当利用专家过程信息,我们提出过程克隆,其应用监督式序列预测来模仿一系列专家计算。如此,过程克隆不仅学习做什么(即输出动作),还学习如何及为何做(即过程)。通过对导航、模拟机器人操控和游戏环境的实证分析,我们表明模仿专家行为的中间计算使过程克隆能够学到对未见环境配置(包括那些直接运行专家过程不可行的配置)展现出显著泛化的策略。
引用
@article{arxiv.2205.10816,
title = {Chain of Thought Imitation with Procedure Cloning},
author = {Mengjiao Yang and Dale Schuurmans and Pieter Abbeel and Ofir Nachum},
journal= {arXiv preprint arXiv:2205.10816},
year = {2022}
}