中文

可解释概念瓶颈对齐强化学习智能体

机器学习 2024-10-30 v4 符号计算

摘要

目标错位、奖励稀疏和信用分配困难仅是深度强化学习(RL)智能体难以学习最优策略的诸多问题中的一部分。遗憾的是,深度神经网络的黑箱特性阻碍了领域专家介入检查模型并修正次优策略。为此,我们引入了*连续概念瓶颈智能体*(SCoBots),它集成了连续的概念瓶颈(CB)层。与当前的CB模型相比,SCoBots不仅将概念表示为单个对象的属性,还表示为对象之间的关系,这对许多RL任务至关重要。我们的实验结果证明了SCoBots具有竞争力的性能,也展示了其让领域专家理解和规范其行为的潜力。其中,SCoBots使我们能够识别出经典视频游戏《Pong》中一个此前未知的错位问题并加以解决。总体而言,SCoBots因此产生了更符合人类意图的RL智能体。我们的代码可在 https://github.com/k4ntz/SCoBots 获取。

关键词

引用

@article{arxiv.2401.05821,
  title  = {Interpretable Concept Bottlenecks to Align Reinforcement Learning Agents},
  author = {Quentin Delfosse and Sebastian Sztwiertnia and Mark Rothermel and Wolfgang Stammer and Kristian Kersting},
  journal= {arXiv preprint arXiv:2401.05821},
  year   = {2024}
}

备注

10 of main text, lots of appendices