基于转移距离表示学习的辅助奖励生成
机器学习
2024-02-13 v1 人工智能
摘要
强化学习(RL)在具有挑战性的序列决策问题中展现了其优势。RL 中的奖励函数对学习性能至关重要,因为它作为任务完成度的度量。在现实问题中,奖励主要是人工设计的,这需要费力的调整,并且容易受到人类认知偏差的影响。为实现自动辅助奖励生成,我们提出了一种新颖的表示学习方法,可以度量状态间的“转移距离”。基于这些表示,我们引入了一种无需人类知识的辅助奖励生成技术,适用于单任务和技能链式场景。所提出的方法在广泛的操控任务中进行了评估。实验结果表明了度量状态间转移距离的有效性以及辅助奖励带来的改进,这不仅促进了更好的学习效率,还提高了收敛稳定性。
引用
@article{arxiv.2402.07412,
title = {Auxiliary Reward Generation with Transition Distance Representation Learning},
author = {Siyuan Li and Shijie Han and Yingnan Zhao and By Liang and Peng Liu},
journal= {arXiv preprint arXiv:2402.07412},
year = {2024}
}