带折旧资产的强化学习
人工智能
2023-03-01 v1 计算工程、金融与科学
最优化与控制
摘要
传统强化学习的一个基本假设是,奖励的价值一旦被智能体接收便不再改变。本研究放弃了这一假设,并考虑奖励的价值随其获取后流逝的时间成比例衰减的情形。强调支付时刻出现的拐点,我们使用“资产”一词来指代当前由智能体拥有的奖励。采用这一术语,我们在无限视界定量优化框架内开启了对折旧资产的研究。具体而言,受经典指数贴现启发,我们提出了一种资产折旧概念,其中资产的价值在智能体获取后的每个时间步均按固定贴现因子进行缩放。我们在此背景下构建了最优性的 Bellman 风格方程刻画,并开发了一种无模型强化学习方法以获取最优策略。
引用
@article{arxiv.2302.14176,
title = {Reinforcement Learning with Depreciating Assets},
author = {Taylor Dohmen and Ashutosh Trivedi},
journal= {arXiv preprint arXiv:2302.14176},
year = {2023}
}
备注
Full version of extended abstract appearing in the proceedings of AAMAS 2023