具有稠密奖励的拟度量价值函数
机器学习
2024-09-16 v1 人工智能
摘要
作为强化学习(RL)向可参数化目标的推广,目标条件强化学习(GCRL)具有广泛的应用,尤其是在机器人领域的挑战性任务中。最近的研究表明,GCRL的最优价值函数具有拟度量结构,从而催生了尊重这种结构的针对性神经架构。然而,相关分析假设了稀疏奖励设置——这是一个已知会加剧样本复杂性的因素。我们证明,支撑拟度量的关键属性,即三角不等式,在稠密奖励设置下同样得以保留。与早期发现稠密奖励对GCRL有害的研究结果相反,我们确定了三角不等式成立的必要条件。满足此条件的稠密奖励函数只会改善而不会恶化样本复杂性。这为使用稠密奖励训练高效的神经架构开辟了机会,从而复合其对样本复杂性的益处。我们在GCRL的12个标准基准环境中评估了这一提议,这些环境包含具有挑战性的连续控制任务。我们的实证结果证实,在我们的稠密奖励设置下训练拟度量价值函数确实优于使用稀疏奖励的训练。
引用
@article{arxiv.2409.08724,
title = {Quasimetric Value Functions with Dense Rewards},
author = {Khadichabonu Valieva and Bikramjit Banerjee},
journal= {arXiv preprint arXiv:2409.08724},
year = {2024}
}