按你的方式强化学习:通过策略正则化进行智能体刻画
机器学习
2022-03-25 v1 人工智能
摘要
最先进的强化学习(RL)算法日益复杂,导致其不透明性,阻碍了可解释性和理解。这促使了多种事后可解释性方法的发展,这些方法旨在从学习到的策略中提取信息,从而辅助可解释性。这些方法依赖于对策略的经验观察,因此旨在泛化出智能体行为的刻画。在本研究中,我们转而开发了一种方法,通过对其目标函数进行正则化,将一种特征行为注入到智能体的策略中。我们的方法在学习过程中引导智能体的行为,从而产生一种内在的刻画;它将学习过程与模型解释联系起来。我们为所提方法的可行性提供了形式化论证和经验证据。在未来的工作中,我们打算利用它来开发能够根据个人消费个性优化个人金融客户投资组合的智能体。
引用
@article{arxiv.2201.10003,
title = {Reinforcement Learning Your Way: Agent Characterization through Policy Regularization},
author = {Charl Maree and Christian Omlin},
journal= {arXiv preprint arXiv:2201.10003},
year = {2022}
}