离线行为数据选择
机器学习
2025-12-23 v1 人工智能
摘要
行为克隆是从专家演示中进行离线策略学习的常用方法。然而,大规模离线行为数据集常常在下游任务中导致计算密集型训练。本文发现离线行为数据存在显著的数据饱和现象:当仅使用数据集的少数部分进行训练时,策略性能就会迅速饱和。我们将这一现象归因于策略性能与测试损失之间的弱对齐,表明通过数据选择仍有显著的提升空间。为此,我们提出一种简单而有效的方法,称为Stepwise Dual Ranking (SDR),从大规模离线行为数据集中提取出紧凑且信息丰富的子集。SDR基于两个关键原则:(1) 步进裁剪(stepwise clip),优先选择早期阶段的数据;(2) 双重排序(dual ranking),选择同时具有高动作价值排序和低状态密度排序的样本。在D4RL基准上的大量实验和消融研究表明,SDR显著提高了离线行为数据的选择效率。
引用
@article{arxiv.2512.18246,
title = {Offline Behavioral Data Selection},
author = {Shiye Lei and Zhihao Cheng and Dacheng Tao},
journal= {arXiv preprint arXiv:2512.18246},
year = {2025}
}
备注
Accepted by KDD 2026