在 RL 中的拼接是否是时间差学习的黄金标准?
机器学习
2025-10-28 v1 人工智能
机器学习
摘要
强化学习 (RL) 有望解决长期任务,即使训练数据仅包含行为的短片段。这种经验拼接能力常被视为时间差 (TD) 方法的专属领域。然而,除了小型表格设置外,轨迹从不相交,这质疑了这一常规智慧。此外,普遍认为蒙特卡洛 (MC) 方法不应该能够重新组合经验,但是否可以通过函数近似实现隐式拼接仍不清楚。本文旨在经验性地研究常规智慧关于拼接在使用函数近似的设置中是否真实成立。我们经验性地证明,蒙特卡洛 (MC) 方法也能实现经验拼接。虽然 TD 方法确实实现了略强的拼接能力(符合常规智慧),但这一差距远小于小型和大型神经网络之间的差距(即使在简单任务上也是如此)。我们发现,提高 critic 容量有效地减少了 MC 和 TD 方法之间的泛化差距。这些结果表明,传统的 TD 用于拼接的归纳偏差可能在大型 RL 模型时代不再是必需的,在某些情况下可能提供递减的收益。此外,我们的结果表明,拼接——这是 RL 环境中一种独特的泛化形式——可能并非通过专门的算法(时间差学习)来实现,而是通过其他机器学习领域已提供的泛化配方(通过规模实现)。项目网站:https://michalbortkiewicz.github.io/golden-standard/
引用
@article{arxiv.2510.21995,
title = {Is Temporal Difference Learning the Gold Standard for Stitching in RL?},
author = {Michał Bortkiewicz and Władysław Pałucki and Mateusz Ostaszewski and Benjamin Eysenbach},
journal= {arXiv preprint arXiv:2510.21995},
year = {2025}
}
备注
The first two authors contributed equally. Project website: https://michalbortkiewicz.github.io/golden-standard/