用于学习值函数的鲁棒损失
机器学习
2023-04-19 v2
摘要
强化学习中的大多数值函数学习算法都基于均方(投影)贝尔曼误差。然而,众所周知,平方误差对异常值敏感,既会扭曲目标的解,也会导致高幅度和高方差的梯度。为了控制这些高幅度的更新,强化学习中的典型策略包括梯度裁剪、奖励裁剪、奖励缩放或误差裁剪。虽然这些策略似乎与鲁棒损失(如Huber损失)有关,但它们建立在半梯度更新规则之上,而这些规则并不最小化一个已知的损失。在这项工作中,我们基于将平方贝尔曼误差重新表述为鞍点优化问题的最新见解,为Huber贝尔曼误差和绝对贝尔曼误差提出了一个鞍点重新表述。我们从鲁棒损失的形式化定义出发,然后推导出基于梯度的可靠方法,以在在线离策略预测和控制设置中最小化这些损失。我们刻画了鲁棒损失的解的特性,从而深入了解了在哪些问题设置下,鲁棒损失定义的解明显优于均方贝尔曼误差。最后,我们表明,由此产生的基于梯度的算法在预测和控制方面都更稳定,对元参数的敏感性更低。
引用
@article{arxiv.2205.08464,
title = {Robust Losses for Learning Value Functions},
author = {Andrew Patterson and Victor Liao and Martha White},
journal= {arXiv preprint arXiv:2205.08464},
year = {2023}
}
备注
IEEE Transactions on Pattern Analysis and Machine Intelligence (2022)