线性 Bellman 完备性下确定性动力学的高效强化学习
机器学习
2025-03-04 v2 机器人学
系统与控制
系统与控制
摘要
我们研究了针对线性 Bellman 完备设置的计算和统计高效强化学习算法。该设置使用线性函数逼近来捕捉价值函数,并统一了诸如线性马尔可夫决策过程(MDP)和线性二次调节器(LQR)等现有模型。尽管已知该设置在统计上是可行的,但是否存在计算高效的算法仍是未知的。我们的工作提供了一个针对线性 Bellman 完备设置的计算高效算法,适用于动作空间大、随机初始状态和随机奖励的 MDP,但依赖于底层动力学为确定性。我们的做法基于随机化:我们向最小二乘回归问题中注入随机噪声,以执行乐观价值迭代。我们的关键技术贡献是仔细设计噪声,仅作用于训练数据中的零空间,以确保乐观性同时规避细微的误差放大问题。
引用
@article{arxiv.2406.11810,
title = {Computationally Efficient RL under Linear Bellman Completeness for Deterministic Dynamics},
author = {Runzhe Wu and Ayush Sekhari and Akshay Krishnamurthy and Wen Sun},
journal= {arXiv preprint arXiv:2406.11810},
year = {2025}
}
备注
Accepted at ICLR 2025 as oral presentation