分布强化学习中具有可解释参数调整的鲁棒分位数 Huber 损失
机器学习
2024-01-09 v2 机器学习
摘要
分布强化学习 (RL) 主要通过最小化分位数 Huber 损失函数来学习分位数值,从而估计回报分布;该过程涉及一个阈值参数,通常通过启发式方法或超参数搜索进行选择,这可能泛化性不佳且并非最优。本文介绍了一种广义分位数 Huber 损失函数,该函数源自高斯分布之间的 Wasserstein 距离 (WD) 计算,能够捕捉预测(当前)分位数值和目标(Bellman 更新)分位数值中的噪声。与经典分位数 Huber 损失相比,这一创新损失函数增强了对异常值的鲁棒性。值得注意的是,经典 Huber 损失函数可视为我们提出损失函数的近似,从而能够在学习过程中通过近似数据中的噪声量来进行参数调整。在分布 RL 的常见应用 Atari 游戏以及最近使用分布 RL 的对冲策略上进行的实证测试,验证了我们提出的损失函数的有效性及其在分布 RL 中进行参数调整的潜力。所提出损失函数的实现代码在此提供。
引用
@article{arxiv.2401.02325,
title = {A Robust Quantile Huber Loss With Interpretable Parameter Adjustment In Distributional Reinforcement Learning},
author = {Parvin Malekzadeh and Konstantinos N. Plataniotis and Zissis Poulos and Zeyu Wang},
journal= {arXiv preprint arXiv:2401.02325},
year = {2024}
}
备注
6 pages, 1 figure, to be published in ICASSP 2024