中文

有界风险敏感马尔可夫博弈:基于迭代推理与累积前景理论的前向策略设计与逆奖励学习

机器学习 2021-03-23 v7 机器学习

摘要

在正向策略设计问题与逆奖励学习问题中,经典博弈论方法对多智能体系统常做出强理性假设:智能体在不确定性下完美最大化期望效用。然而,此类假设与观察到的人类行为(如满意化、次优、风险寻求与损失厌恶决策)严重不符。本文研究有界风险敏感马尔可夫博弈(BRSMG)及其逆奖励学习问题,以建模人类真实行为并学习人类行为模型。借助迭代推理模型与累积前景理论,我们采纳人类具有有界智能并在 BRSMG 中最大化风险敏感效用。在 BRSMG 框架下建立了正向策略设计与逆奖励学习问题的收敛性分析。我们在导航场景中验证了所提出的正向策略设计与逆奖励学习算法。结果表明,智能体行为展现出风险厌恶与风险寻求双重特征。此外,在逆奖励学习任务中,所提出的有界风险敏感逆学习算法不仅更有效地恢复了更准确的奖励值,还恢复了智能体交互行为演示中所给出的智能水平与风险度量参数,优于基线的风险中性逆学习算法。

关键词

引用

@article{arxiv.2009.01495,
  title  = {Bounded Risk-Sensitive Markov Games: Forward Policy Design and Inverse Reward Learning with Iterative Reasoning and Cumulative Prospect Theory},
  author = {Ran Tian and Liting Sun and Masayoshi Tomizuka},
  journal= {arXiv preprint arXiv:2009.01495},
  year   = {2021}
}

备注

Accepted by 2021 AAAI Conference on Artificial Intelligence