中文

具有异质时间偏好的目标一致聚合需要非马尔可夫奖励

机器学习 2023-10-03 v1 人工智能

摘要

随着人工智能体能力的提升,它们正越来越多地被部署以服务多个不同的目标与利益相关方。然而,这些目标的组合往往是临时拼凑的,缺乏明确的依据。本文对多目标代理(multi-objective agency)采取了一种规范性研究方法:从一组直观上合理的公理出发,我们证明了当各目标的时间偏好(折扣因子)可能不同时,对马尔可夫奖励函数进行马尔可夫式聚合是不可能的。由此推知,最优的多目标智能体必须接受相对于各个体目标而言为非马尔可夫的奖励。为此,本文提出了一种实用的非马尔可夫聚合方案,仅通过为每个目标增加一个额外参数便克服了上述不可能性。本工作为序列式多目标代理与跨期选择提供了新见解,并对服务于具有不同时间偏好的多代委托人的 AI 系统设计具有实际意义。

关键词

引用

@article{arxiv.2310.00435,
  title  = {Consistent Aggregation of Objectives with Diverse Time Preferences Requires Non-Markovian Rewards},
  author = {Silviu Pitis},
  journal= {arXiv preprint arXiv:2310.00435},
  year   = {2023}
}

备注

In Proceedings of NeurIPS 2023. 10 pages (+4 references, +3 appendix)