面向离线交互数据的距离加权监督学习
机器学习
2023-04-28 v1
摘要
序列决策算法通常难以利用不同来源的非结构化离线交互数据。基于监督学习的模仿学习(IL)方法虽然稳健,但需要最优演示,而这些演示很难收集。离线目标条件强化学习(RL)算法有望从次优数据中学习,但面临优化挑战,尤其是在高维数据方面。为了弥合IL和RL之间的差距,我们引入了距离加权监督学习或DWSL,这是一种从离线数据中学习目标条件策略的监督方法。DWSL仅使用监督学习对离线数据中状态之间的所有时间步分布进行建模,并使用该分布来近似最短路径距离。为了提取策略,我们根据动作对距离估计的减少量对其进行加权。在理论上,DWSL收敛于受数据分布约束的最优策略,这对于离线学习是一个极具吸引力的性质,且不需要任何自举。在我们测试的所有数据集中,DWSL在经验上将行为克隆作为下限,同时仍展现出策略改进。在高维图像领域,DWSL超越了先前的目标条件IL和RL算法的性能。可视化与代码可在 https://sites.google.com/view/dwsl/home 获取。
引用
@article{arxiv.2304.13774,
title = {Distance Weighted Supervised Learning for Offline Interaction Data},
author = {Joey Hejna and Jensen Gao and Dorsa Sadigh},
journal= {arXiv preprint arXiv:2304.13774},
year = {2023}
}
备注
ICML 2023