BCR-DRL:面向人机协同的深度强化学习中的行为与上下文感知奖励
人工智能
2025-08-04 v5 机器学习
摘要
深度强化学习(DRL)为训练AI代理与人类伙伴协同提供了强大框架。然而,DRL在人机协同(HAIC)中面临两个关键挑战:稀疏奖励和不可预测的人类行为。这些挑战严重限制了DRL识别有效协同策略的能力,因其优化探索与利用的能力受损。为解决这些局限性,我们提出了一种创新的行为与上下文感知奖励(BCR)用于DRL,通过利用人机协同中的人类行为和上下文信息来优化探索与利用。我们的BCR由两个组成部分构成:(i)一种新颖的双重内在奖励方案以增强探索。该方案由AI自驱内在奖励和人类驱动内在奖励组成,通过基于对数策略设计以提高对稀疏奖励的捕获;(ii)一种新的上下文感知加权机制以改善利用。该机制通过利用能够反映学习演化的上下文信息,帮助AI代理优先选择更能与人类伙伴协同的动作。在Overcooked环境中的大量仿真表明,与最先进的基线方法相比,我们的方法可将累积稀疏奖励提高约20%,并将样本效率提高约38%。
引用
@article{arxiv.2408.07877,
title = {BCR-DRL: Behavior- and Context-aware Reward for Deep Reinforcement Learning in Human-AI Coordination},
author = {Xin Hao and Bahareh Nakisa and Mohmmad Naim Rastgoo and Gaoyang Pang},
journal= {arXiv preprint arXiv:2408.07877},
year = {2025}
}