教导预约定代理:准超几何折扣 MDP 中的模型无关策略评估与控制
机器学习
2025-09-09 v1 人工智能
摘要
时间不一致的偏好是人类和动物决策中的关键特征,准超几何(Quasi-Hyperbolic, QH)折扣提供了一种简单而强大的模型来刻画这一行为,但其在强化学习(RL)框架中的集成仍有限。本文解决了针对具有QH偏好的预约定代理的关键理论和算法空白。我们做出两个主要贡献:(i)我们正式刻画了最优策略的结构,首次证明其可归约为简单的一阶非平稳形式;(ii)我们设计了第一个实用的、模型无关的算法,用于该情境下的策略评估和Q学习,两者都具备可证明的收敛保证。我们的结果为在RL中纳入QH偏好提供了基础性见解。
引用
@article{arxiv.2509.06094,
title = {Teaching Precommitted Agents: Model-Free Policy Evaluation and Control in Quasi-Hyperbolic Discounted MDPs},
author = {S. R. Eshwar},
journal= {arXiv preprint arXiv:2509.06094},
year = {2025}
}