帕累托条件网络
机器学习
2022-04-12 v1 人工智能
摘要
在多目标优化中,学习所有达到帕累托最优解的策略是一个代价高昂的过程。最优策略集合可能随目标数量呈指数增长,而恢复所有解需要对整个状态空间进行穷举探索。我们提出帕累托条件网络(Pareto Conditioned Networks, PCN),一种使用单个神经网络涵盖所有非支配策略的方法。PCN 将每一次过去的状态转移与其回合的回报相关联,并训练网络使得在以此相同回报为条件时,能够重演该转移。由此我们将优化问题转化为分类问题。我们通过将网络条件设定于所需的帕累托最优解来恢复具体策略。我们的方法以监督方式学习,因而稳定,避免了目标漂移问题。此外,通过使用单个网络,PCN 随目标数量高效扩展。最后,它对帕累托前沿的形状做出极小假设,这使其比以往最先进的多目标强化学习算法适用于更广泛的问题。
引用
@article{arxiv.2204.05036,
title = {Pareto Conditioned Networks},
author = {Mathieu Reymond and Eugenio Bargiacchi and Ann Nowé},
journal= {arXiv preprint arXiv:2204.05036},
year = {2022}
}
备注
Accepted at the International Conference on Autonomous Agents and Multiagent Systems (AAMAS) 2022