面向强化学习智能体的个性化路径追索
机器学习
2024-11-05 v3 人工智能
摘要
本文引入了个性化路径追索,一种为强化学习智能体生成追索路径的新方法。其目标是编辑给定的动作路径以实现预期目标(例如,与智能体原始路径相比获得更好的结果),同时确保与智能体原始路径的高度相似性,并针对智能体进行个性化。个性化是指新路径针对智能体从其策略函数中观察到的行为模式进行定制的程度。我们训练了一个个性化追索智能体来生成此类个性化路径,这些路径是通过考虑目标、相似性和个性化的奖励函数获得的。所提出的方法适用于强化学习和监督学习设置,用于纠正或改进动作序列或数据序列以实现预定目标。该方法在各种设置下进行了评估。实验表明,我们的模型不仅能追索以获得更好的结果,还能适应不同智能体的行为。
引用
@article{arxiv.2312.08724,
title = {Personalized Path Recourse for Reinforcement Learning Agents},
author = {Dat Hong and Tong Wang},
journal= {arXiv preprint arXiv:2312.08724},
year = {2024}
}