导航权衡:多目标强化学习的策略概括
人工智能
2024-11-08 v1 机器学习
摘要
多目标强化学习(MORL)用于解决涉及多个目标的问题。MORL智能体必须基于由不同奖励函数提供的多样化信号做出决策。训练MORL智能体会产生一组解决方案(策略),每种解决方案在目标之间呈现不同的权衡(预期收益)。MORL通过使智能体能够基于其权衡进行粗粒度比较,而不是仅有一个单一策略,从而增强可解释性。然而,解决方案集通常很大且多维,每种策略(例如,一个神经网络)都由其目标值表示。我们提出了一种聚类MORL生成的解决方案集的方法。通过同时考虑策略行为和目标值,我们的聚类方法可以揭示策略行为与目标空间中区域之间的关系。这一方法可以使决策者(DM)能够识别解决方案集中的总体趋势和见解,而不是逐个检查每个策略。我们在四个多目标环境中测试了该方法,发现其优于传统的k-medoids聚类。此外,我们包括一个案例研究,演示了其实际应用。
引用
@article{arxiv.2411.04784,
title = {Navigating Trade-offs: Policy Summarization for Multi-Objective Reinforcement Learning},
author = {Zuzanna Osika and Jazmin Zatarain-Salazar and Frans A. Oliehoek and Pradeep K. Murukannaiah},
journal= {arXiv preprint arXiv:2411.04784},
year = {2024}
}