UNIQ:用于避免不可取演示的离线逆 Q 学习
机器学习
2024-10-14 v1 人工智能
摘要
我们解决了离线学习以避免不可取演示的策略问题。与传统离线模仿学习方法不同,后者旨在模仿专家或接近最优的演示,而本文的设置涉及避免不可取的行为(使用不可取的演示指定)。为解决这一问题,与标准模仿学习不同,后者旨在最小化学习策略与专家演示之间的距离,我们将学习任务形式化为在状态-动作 stationary 分布空间中最大化学习策略与不可取策略之间的统计距离。这一截然不同的做法导致了一个新的训练目标,要求开发新的算法来处理该问题。我们的算法 UNIQ 通过基于逆 Q 学习框架来解决这些挑战,将学习问题建模为合作(非对抗)任务。随后,我们展示了如何有效地利用无标签数据进行实际训练。我们在标准基准环境中评估了该方法,结果一致优于最先进的基线方法。该代码实现可在 https://github.com/hmhuy0/UNIQ 上访问。
引用
@article{arxiv.2410.08307,
title = {UNIQ: Offline Inverse Q-learning for Avoiding Undesirable Demonstrations},
author = {Huy Hoang and Tien Mai and Pradeep Varakantham},
journal= {arXiv preprint arXiv:2410.08307},
year = {2024}
}