多任务拟合Q迭代与离线Q学习中的泛化
机器学习
2026-04-28 v2
摘要
我们研究了在多个任务共享其动作价值函数低秩表示的情况下的离线多任务强化学习。在此情境下,学习者仅获得来自多个相关任务的固定数据集,无法进行进一步的在线交互,旨在利用共享结构来提高统计效率和泛化能力。我们分析了一种多任务拟合Q迭代方法,该方法通过对离线数据上的贝尔曼误差最小化来联合学习共享表示和任务特定的价值函数。在标准的可实现性和覆盖假设下,我们为所学价值函数建立了有限样本的泛化保证。我们的分析显式地刻画了如何通过跨任务汇聚数据来提高估计精度,得到对总样本数的依赖,同时保持对时域和集中性系数的常规依赖,这些系数源于分布迁移。在此基础上,我们考虑了一种下游离线情境,其中新任务与上游任务共享相同的底层表示。我们研究了在多任务阶段所学表示的重用如何影响该新任务的值估计,证明了这可以相对于从零开始学习降低下游学习的有效复杂度。总体而言,我们的结果阐明了共享表示在多任务离线Q学习中的作用,为何以及如何在无模型、基于价值的强化学习中利用多任务结构实现泛化提供了理论依据。
引用
@article{arxiv.2512.20220,
title = {Generalisation in Multitask Fitted Q-Iteration and Offline Q-learning},
author = {Kausthubh Manda and Raghuram Bharadwaj Diddigi},
journal= {arXiv preprint arXiv:2512.20220},
year = {2026}
}
备注
18 pages (9 pages + Appendix and references), this is version 1