基于Bayes自适应POMDP的半人马型人机最佳响应贝叶斯强化学习
人工智能
2022-04-05 v1 机器学习
多智能体系统
摘要
Centaurs(半人半AI决策者)中,AI的目标是补充人类。为此,AI必须能够识别人类的目标与约束,并具备帮助人类的手段。我们提出一种新的人与AI交互形式化方法,将其建模为序贯博弈,其中智能体采用贝叶斯最佳响应模型。我们表明,在此情形下,AI帮助有限理性人类做出更好决策的问题可归约为一个Bayes自适应POMDP。在模拟实验中,我们考虑了该框架在一类主观上对AI未来行为持乐观态度的人类上的实例化。结果表明,当AI配备人类模型时,能够推断人类的局限并引导其做出更好决策。我们讨论了机器如何在人类帮助下学习克服自身局限的途径。我们指出了部分可观测任务中半人马型系统的一个新权衡:为使AI的动作被人类接受,机器必须确保双方信念充分对齐,但对齐信念可能代价高昂。我们对该权衡及其对任务结构的依赖性给出了初步理论分析。
引用
@article{arxiv.2204.01160,
title = {Best-Response Bayesian Reinforcement Learning with Bayes-adaptive POMDPs for Centaurs},
author = {Mustafa Mert Çelikok and Frans A. Oliehoek and Samuel Kaski},
journal= {arXiv preprint arXiv:2204.01160},
year = {2022}
}
备注
This paper is presented in part at the International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS) 2022