中文

探索可调代理在序贯社会困境中的影响

多智能体系统 2021-01-29 v1 人工智能

摘要

在开发强化学习代理时,标准方法是训练一个代理收敛到固定策略,该策略对于单一固定奖励函数尽可能接近最优。如果未来需要不同的代理行为,通常以这种方式训练的代理必须完全或部分重新训练,浪费宝贵的时间与资源。在本研究中,我们利用多目标强化学习来创建可调代理,即能够根据设计者偏好采取一系列不同行为而无需重新训练的代理。我们将该技术应用于序贯社会困境,即个体理性与集体理性之间存在固有张力的环境。在此类环境中学习单一固定策略,若对手策略在学习完成后改变,会使自己处于显著劣势。在我们的工作中,我们通过实验证明可调代理框架允许在序贯社会困境中轻松在合作与竞争行为间适应而无需重新训练,使得单一训练好的代理模型可被调整以适应广泛的行为与对手策略。

关键词

引用

@article{arxiv.2101.11967,
  title  = {Exploring the Impact of Tunable Agents in Sequential Social Dilemmas},
  author = {David O'Callaghan and Patrick Mannion},
  journal= {arXiv preprint arXiv:2101.11967},
  year   = {2021}
}