面向单智能体与联邦强化学习的低成本后悔最优 Q 学习
机器学习
2026-03-11 v2 机器学习
摘要
受现实场景中数据收集和策略部署成本(无论是针对单个智能体还是多个智能体)的限制,我们聚焦于降低 burn-in 成本(即达到接近最优后悔所需的样本量)和策略切换或通信成本的问题。在平行的有限时段多智能体马尔可夫决策过程(MDP)中具有 个状态和 个动作,现有方法要么需要 和 的超线性 burn-in 成本,要么无法实现对数级别的策略切换成本或通信成本。我们提出了两种新的无模型强化学习算法——Q-EarlySettled-LowCost 和 FedQ-EarlySettled-LowCost——这些算法是文献中首次同时实现:(i)所有已知无模型强化学习或联邦强化学习算法中最好的近最优后悔;(ii)随着 和 线性增长的低 burn-in 成本;(iii)针对单智能体强化学习的对数策略切换成本或针对联邦强化学习的对数通信成本。此外,我们为两种算法建立了基于间隔的理论保证,对 regret 和切换/通信成本提供改进或匹配的最佳已知界限。
关键词
引用
@article{arxiv.2506.04626,
title = {Regret-Optimal Q-Learning with Low Cost for Single-Agent and Federated Reinforcement Learning},
author = {Haochen Zhang and Zhong Zheng and Lingzhou Xue},
journal= {arXiv preprint arXiv:2506.04626},
year = {2026}
}
备注
arXiv admin note: text overlap with arXiv:2502.02859