中文

用于可解释行为表示的多意图逆 Q 学习

机器学习 2024-09-11 v4 神经元与认知

摘要

为增进对自然决策过程的理解,逆强化学习(IRL)方法已证明有助于重构动物复杂行为背后的意图。鉴于近期连续时间多意图 IRL 框架的发展,关于利用 IRL 推断离散时变奖励的探究持续不断。为应对该挑战,我们引入一类分层逆 Q 学习(HIQL)算法。通过无监督学习过程,HIQL 将专家轨迹划分为多个意图片段,并分别独立求解各片段的 IRL 问题。将 HIQL 应用于模拟实验与多个真实动物行为数据集,我们的方法在行为预测上优于当前基准,并产出可解释的奖励函数。我们的结果表明,复杂决策行为背后的意图转移动态更宜用阶跃函数而非平滑变化函数建模。这一进展有望惠及神经科学与认知科学,增进对决策的理解并揭示潜在的脑机制。

关键词

引用

@article{arxiv.2311.13870,
  title  = {Multi-intention Inverse Q-learning for Interpretable Behavior Representation},
  author = {Hao Zhu and Brice De La Crompe and Gabriel Kalweit and Artur Schneider and Maria Kalweit and Ilka Diester and Joschka Boedecker},
  journal= {arXiv preprint arXiv:2311.13870},
  year   = {2024}
}