强化学习中时间离散化的一个独特现象
机器学习
2024-09-04 v2 人工智能
摘要
许多强化学习算法建立在智能体与环境在固定时长、离散时间步 interactions 上的假设之上。然而,物理系统是连续时间的,在数字控制时需要选择时间离散化的粒度。此外,这些系统在做出决策前不会等待,从而需要研究离散化选择如何影响强化学习算法。在本工作中,我们考察连续时间与离散时间回报之间的关系。具体地,我们认识到对离散化连续时间环境直接应用离散时间算法的一个独特现象,并指出一种简单修改可更好地对齐回报定义。这一观察在处理时间离散化粒度可选择或此类粒度本质上是随机的情形时具有实际意义。
引用
@article{arxiv.2406.14951,
title = {An Idiosyncrasy of Time-discretization in Reinforcement Learning},
author = {Kris De Asis and Richard S. Sutton},
journal= {arXiv preprint arXiv:2406.14951},
year = {2024}
}
备注
RLC 2024