在马尔可夫决策过程中计算考虑执行期人类智能体不确定性影响的策略
人工智能
2022-03-07 v3
摘要
当人类被执行给定策略时,若状态辨识存在不确定性,则可能出现策略执行错误与偏离。这可能源于人类智能体的认知局限和/或感知错误。因此,为人类计算待执行策略的算法应在其计算中考虑这些影响。一个因人类智能体而执行不佳的最优马尔可夫决策过程(MDP)策略,可能远差于另一在MDP中次优但考虑了人类智能体执行行为的策略。本文我们考虑由状态不确定性引起的两个问题:错误的状态推断,以及人因其不确定性可能采取的额外感知动作。我们提出一个框架以建模人类智能体在状态不确定性下的行为,并可用于计算考量这些问题的MDP策略。随后给出爬山算法以基于我们的人类智能体模型搜索优良策略。我们还提出一种分支定界算法,可求解此类问题的最优策略。我们在Gridworld域与仓库工人域展示了实验结果,最后给出支持我们人类模型假设的用户研究。
引用
@article{arxiv.2109.07436,
title = {Computing Policies That Account For The Effects Of Human Agent Uncertainty During Execution In Markov Decision Processes},
author = {Sriram Gopalakrishnan and Mudit Verma and Subbarao Kambhampati},
journal= {arXiv preprint arXiv:2109.07436},
year = {2022}
}
备注
7 page paper, 6 pages supplemental material