影响的快照:一种在线强化学习的局部数据归因框架
机器学习
2025-10-07 v2
摘要
在线强化学习(RL)在复杂、安全攸关的领域中表现出色,但存在样本效率低、训练不稳定和可解释性有限的问题。数据归因提供了一种将模型行为追溯至训练样本的原则性方法,但现有方法假设数据集是固定的,这在在线 RL 中不成立,因为每次经验既更新策略又塑造未来的数据收集。在本文中,我们开启了对在线 RL 数据归因的研究,重点关注广泛使用的近端策略优化(PPO)算法。我们首先建立了一个局部归因框架,针对近期训练缓冲区中的记录来解释模型检查点。我们设计了两个目标函数,分别捕获智能体的动作和累积回报,并通过其训练损失与这些目标之间的梯度相似性来衡量每条记录的贡献。我们通过三个具体应用展示了该框架的强大功能:学习诊断、行为形成的时序分析以及训练期间的定向干预。利用该框架,我们进一步提出了一种用于在线 RL 训练的算法,即迭代基于影响的过滤(IIF),该算法迭代地执行经验过滤以改进策略更新。从标准 RL 基准(经典控制、导航、移动)到大语言模型的 RLHF,IIF 降低了样本复杂度,加快了训练速度,并实现了更高的回报。这些结果共同为使在线 RL 更具可解释性、高效性和有效性开辟了新方向。
引用
@article{arxiv.2505.19281,
title = {A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement Learning},
author = {Yuzheng Hu and Fan Wu and Haotian Ye and David Forsyth and James Zou and Nan Jiang and Jiaqi W. Ma and Han Zhao},
journal= {arXiv preprint arXiv:2505.19281},
year = {2025}
}
备注
Accepted at NeurIPS 2025 as an oral