迈向可协商的强化学习:帕累托最优序贯决策中的优先级转换
人工智能
2017-05-16 v3 计算机科学与博弈论
机器学习
摘要
现有多目标强化学习(MORL)算法未考虑由具有不同信念的参与者所产生的目标。具体而言,考虑两个具有不同信念和效用函数的参与者,他们可能会合作制造一台代表他们采取行动的机器。需要一种表示方法来描述机器的策略随时间在多大程度上优先考虑每个参与者的利益。假设参与者已就其处境达成共同知识,本文推导出任何帕累托最优策略都必须满足的递推关系。从该递推关系可以得出两个定性观察:机器必须(1)在评估某项行动将如何服务于某参与者的效用函数时,使用该参与者自身的信念;并且(2)随时间转换其分配给每个参与者预期效用的相对优先级,转换系数与该参与者的信念预测机器输入的准确程度成正比。观察(2)代表了对朴素线性效用聚合(如Harsanyi效用主义定理及现有MORL算法)的实质性偏离,本文证明这种聚合方式不适用于代表具有不同信念的参与者进行帕累托最优序贯决策。
引用
@article{arxiv.1701.01302,
title = {Toward negotiable reinforcement learning: shifting priorities in Pareto optimal sequential decision-making},
author = {Andrew Critch},
journal= {arXiv preprint arXiv:1701.01302},
year = {2017}
}