中文

概率递归意图切换模型

机器学习 2026-05-27 v1 神经元与认知

摘要

逆强化学习(IRL)从观察行为中恢复奖励函数,但传统方法假设单一稳态奖励,无法捕捉episode内的目标切换。近期的多意图IRL方法通过分割轨迹来解决此问题,但将意图转换建模为无记忆马尔可夫链或通过手动状态增广以固定历史窗口形式实现。我们提出概率递归意图切换模型(Probabilistic Recurrent Intention Switching Model, PRISM),用轻量级递归网络将观察历史映射到每一步的意图分布。我们证明,所得的EM目标恰好分解为独立的per-intention奖励子问题,每个子问题都可闭式求解,实现E步的时间复杂度为O(nK)\mathcal{O}(nK),无需变分近似。我们在非马尔可夫网格世界、老鼠迷宫和BridgeData~V2机器人操作三个基准上评估PRISM,这是多意图IRL的首个大规模机器人应用。在所有设置下,PRISM均实现了最高的 held-out对数似然率,同时从无标记演示中恢复出可命名且具有时序一致性的意图,表明离散目标切换在生物和人工智能体中均存在。

关键词

引用

@article{arxiv.2605.26998,
  title  = {Probabilistic Recurrent Intention Switching Model},
  author = {Wenyuan Sheng and Hao Zhu and Joschka Boedecker},
  journal= {arXiv preprint arXiv:2605.26998},
  year   = {2026}
}