具有未观测上下文的序列模型模仿学习
机器学习
2023-01-18 v3
摘要
我们考虑这样一种模仿学习问题:学习者在某一幕过程中随着更多信息被揭示而逐渐增强模仿专家的能力。一个例子是专家可获取特权信息:虽然学习者可能在幕早期无法准确复现专家行为,但通过考虑状态与动作的整个历史,他们或许最终能识别隐藏上下文并像专家那样行动。我们证明,在线策略(on-policy)模仿学习算法(无论是否能查询专家)比离线策略(off-policy)方法更能应对这类渐近可实现的问题。这是因为在线策略算法可证明学会从其初始次优动作中恢复,而离线策略方法将其次优的过去动作当作来自专家。这常表现为一种锁定行为:对过去动作的朴素重复。我们在一个玩具赌博机域中进行实验,表明离线策略方法能否渐近匹配专家性能存在尖锐的相变,而在线策略方法则表现均匀良好。我们展示了在若干连续控制任务中,在线策略方法能够利用历史识别上下文,而离线策略方法在获得历史访问权时反而表现更差。
引用
@article{arxiv.2208.02225,
title = {Sequence Model Imitation Learning with Unobserved Contexts},
author = {Gokul Swamy and Sanjiban Choudhury and J. Andrew Bagnell and Zhiwei Steven Wu},
journal= {arXiv preprint arXiv:2208.02225},
year = {2023}
}