中文

基于动态稀疏性提升偏好型强化学习中的鲁棒性

机器学习 2025-07-08 v3

摘要

为融入人类无导向环境,自动代理必须学习并适应人类的本土环境。偏好型强化学习(PbRL)可通过从人类偏好中学习奖励函数来实现这一点。然而,人类生活在充满多样信息的世界中,其中大多数信息与完成特定任务无关。因此,代理必须学习专注于任务相关状态特征的子集。为此,本工作提出R2N(Robust-to-Noise),首个利用动态稀疏训练原则学习鲁棒奖励模型以专注于任务相关特征的PbRL算法。在仿真教师实验中,我们展示了R2N能够适应其神经网络稀疏连接以专注于任务相关特征,使R2N在仿真机器人环境中显著优于多个稀疏训练和PbRL算法。

关键词

引用

@article{arxiv.2406.06495,
  title  = {Boosting Robustness in Preference-Based Reinforcement Learning with Dynamic Sparsity},
  author = {Calarina Muslimani and Bram Grooten and Deepak Ranganatha Sastry Mamillapalli and Mykola Pechenizkiy and Decebal Constantin Mocanu and Matthew E. Taylor},
  journal= {arXiv preprint arXiv:2406.06495},
  year   = {2025}
}