多目标强化学习中从演示推断偏好:一种基于动态权重的方法
人工智能
2023-04-28 v1
摘要
许多决策问题具有多个目标。在此类问题中,并不总是能够获知决策者对不同目标的偏好。然而,通常可以观察到决策者的行为。在多目标决策中,偏好推断是指推断决策者对不同目标偏好的过程。本研究提出了一种基于动态权重的偏好推断算法,该算法能够基于环境中观察到的行为轨迹,推断在多目标决策问题中行动的智能体的偏好。所提出的方法在三个多目标马尔可夫决策过程上进行了评估:深海寻宝、交通和物品收集。将所提出的 DWPI 方法的性能与文献中现有的两种偏好推断方法进行了比较,实验结果表明,在时间需求和推断偏好的准确性方面,相较于基线算法均有显著提升。基于动态权重的偏好推断算法在推断次优行为演示的偏好时也能保持其性能。除了出色的性能外,基于动态权重的偏好推断算法在训练期间不需要与被推断偏好的智能体进行任何交互,所需的仅仅是观察到的行为轨迹。
引用
@article{arxiv.2304.14115,
title = {Inferring Preferences from Demonstrations in Multi-objective Reinforcement Learning: A Dynamic Weight-based Approach},
author = {Junlin Lu and Patrick Mannion and Karl Mason},
journal= {arXiv preprint arXiv:2304.14115},
year = {2023}
}
备注
This work is accepted by ALA 2023 Adaptive and Learning Agents Workshop at AAMAS, London, UK