中文

用软极大极小方法提升Bottles环境中多目标决策的性能

人工智能 2022-08-15 v2

摘要

平衡多个竞争且冲突的目标,是任何旨在满足人类价值或偏好的人工智能的基本任务。冲突既源于持竞争价值观个体间的错位,也源于单个人类所持冲突价值体系之间。从损失厌恶原理出发,我们设计了一组用于多目标决策的软极大极小函数方法。在先前开发的一组环境中对这些函数基准测试,我们发现其中一种新方法——'分裂函数指数-对数损失厌恶'(SFELLA)——在测试的四项任务中的三项上比最先进的阈值对齐目标方法(Vamplew et al, 2021)学习更快,并在学习后达到相同最优性能。SFELLA还显示出对目标尺度变化的相对鲁棒性提升,这可能凸显其在应对环境动态分布偏移上的优势。受发表规则所限,预印本未能呈现进一步工作,但在最终发表版本中,我们将把SFELLA与多目标奖励指数法(MORE)(Rolf, 2020)进一步比较,证明SFELLA在先前描述的简单觅食任务中表现与MORE相近,但在修改后引入一种随智能体工作不被耗竭的新资源的觅食环境中,SFELLA以极旧资源代价收集了更多新资源。总体而言,我们发现SFELLA有助于避免阈值法时而出现的问题,且比MORE更具奖励响应性,同时保留其保守、损失厌恶的激励结构。

关键词

引用

@article{arxiv.2208.04273,
  title  = {Improving performance in multi-objective decision-making in Bottles environments with soft maximin approaches},
  author = {Benjamin J Smith and Robert Klassert and Roland Pihlakas},
  journal= {arXiv preprint arXiv:2208.04273},
  year   = {2022}
}