求解具有词典序偏好的多目标MDP:多分位数目标随机规划中的应用
人工智能
2017-05-11 v1
摘要
在多数常见的马尔可夫决策过程(MDP)设定中,智能体基于(折扣)奖励和的期望来评估策略。然而在许多应用中,该准则可能从两个角度不适合:首先,在风险厌恶情形下,累积奖励的期望不够稳健,这发生在累积奖励分布严重偏斜时;另一个问题是许多应用在评估策略时自然考虑多个目标,例如自动驾驶中智能体需要在选择适当决策时平衡速度与安全。本文中,我们考虑基于策略在一组目标状态上诱导出的一系列分位数来评估策略,我们的思想是将原问题重新表述为具有自然定义的词典序偏好的多目标MDP问题。为计算寻找最优策略,我们提出一种算法 \textbf{FLMDP},可求解具有词典序奖励偏好的通用多目标MDP。
引用
@article{arxiv.1705.03597,
title = {Solving Multi-Objective MDP with Lexicographic Preference: An application to stochastic planning with multiple quantile objective},
author = {Yan Li and Zhaohan Sun},
journal= {arXiv preprint arXiv:1705.03597},
year = {2017}
}