从演示中推断多目标强化学习中的偏好
人工智能
2024-10-01 v1
摘要
许多决策问题都涉及多个目标,人或代理决策者对不同目标的偏好往往难以确定。然而,决策者的演示行为往往是可获得的。本研究提出了一种基于动态权重的偏好推断(DWPI)算法,可从演示中推断代理在多目标决策问题中的偏好。该算法在三个多目标马尔可夫决策过程上进行评估:Deep Sea Treasure、Traffic 和 Item Gathering,并与两种现有偏好推断算法进行比较。实验结果表明,与基线算法相比,DWPI算法在时间效率和推断准确性方面均显著提高。当推断次优演示的偏好时,DWPI算法仍能保持性能。此外,DWPI算法在推断过程中无需与用户进行任何交互——仅需演示。我们对该算法提供了正确性证明和复杂度分析,并对不同演示表示下的性能进行了统计评估。
引用
@article{arxiv.2409.20258,
title = {Inferring Preferences from Demonstrations in Multi-objective Reinforcement Learning},
author = {Junlin Lu and Patrick Mannion and Karl Mason},
journal= {arXiv preprint arXiv:2409.20258},
year = {2024}
}
备注
Neural Comput & Applic (2024)