基于 TabPFN 的无梯度深度强化学习
机器学习
2025-09-16 v1 人工智能
摘要
梯度优化是大多数现代深度强化学习算法的基本方法,但会带来对超参数的高度敏感、训练动态不稳定以及高计算成本等问题。我们提出 TabPFN RL,一种新颖的无梯度深度 RL 框架,复用已通过 meta 训练的 transformer TabPFN 作为 Q 值逼近器。该方法最初为表格分类开发,TabPFN 在数百万合成数据集上进行预训练,以通过原地学习在新见数据的推理。给定一个样本标签对及新未标记数据的数据集,TabPFN 能在单次前向传播中预测最可能的标签,无需梯度更新或任务特定的微调。我们使用 TabPFN 仅进行推理预测 Q 值,从而消除训练和推理中的反向传播需求。为适应模型固定的上下文预算,我们设计一种高奖励剂情门,以保留仅前 5% 的轨迹。在 Gymnasium 经典控制套件上的实验评估表明,TabPFN RL 在 CartPole v1、MountainCar v0 和 Acrobot v1 上达到或超越 Deep Q Network 的性能,期间无需应用梯度下降或进行大规模超参数调优。我们讨论了引导目标和非平稳访问分布如何违反 TabPFN 先验中编码的独立性假设,然而该模型仍保持惊人的泛化能力。我们进一步形式化了原地 RL 算法的固有上下文大小限制,提出原则性的截断策略,使其在上下文满时能够实现持续学习。我们的结果表明,诸如 TabPFN 等已拟合网络可作为快速且计算高效 RL 的可行基础,为基于大型预训练 transformer 的无梯度 RL 开辟了新方向。
引用
@article{arxiv.2509.11259,
title = {Gradient Free Deep Reinforcement Learning With TabPFN},
author = {David Schiff and Ofir Lindenbaum and Yonathan Efroni},
journal= {arXiv preprint arXiv:2509.11259},
year = {2025}
}