CANDERE-COACH:基于噪声反馈的强化学习
机器学习
2024-09-25 v1 人工智能
摘要
近期,强化学习 (RL) 已被广泛应用于许多具有挑战性的任务。然而,要表现良好,需访问良好的奖励函数,而奖励函数往往是稀疏的或需手动工程化且可能出错。引入人类先验知识常被视为解决上述问题的可能方法,例如仿射学习、偏好学习和逆强化学习。从反馈中学习是另一个框架,使 RL 智能体能够从描述教师 (positive 或 negative) 对智能体动作评估的二元信号中学习。然而,这些方法常常假设教师的评估反馈是完美的,这是一项受限的假设。实际情况下,由于教师经验有限或其他导致认知负荷、可用性、分心等因素,此类反馈可能是噪声的。在本工作中,我们提出了 CANDERE-COACH 算法,能够从非最优教师的噪声反馈中进行学习。我们提出了一种去噪机制,用于在线去除噪声反馈数据,从而使 RL 智能体能够在达到 40% 教师反馈错误率时成功学习。在三个常见领域的实验中,证明了所提方法的有效性。
关键词
引用
@article{arxiv.2409.15521,
title = {CANDERE-COACH: Reinforcement Learning from Noisy Feedback},
author = {Yuxuan Li and Srijita Das and Matthew E. Taylor},
journal= {arXiv preprint arXiv:2409.15521},
year = {2024}
}