中文

专家还是非专家?——评估离线强化学习中的数据质量

机器学习 2025-10-15 v1

摘要

离线强化学习(RL)仅依赖静态数据集进行学习,无需与环境进行进一步交互。实际情况下,这些数据集的质量差异很大,常常混合了专家策略、次优策略甚至随机轨迹。因此,算法的选择取决于数据集的保真度。在数据质量较高时,行为克隆即可勉强奏效,而混合或低质量数据则通常受益于能够跨轨迹拼接有效行为的离线RL方法。然而,在实际应用中,由于数据来源和技能组成未知,难以对数据集的质量进行先验评估。我们解决了在不训练智能体的情况下估计离线数据集质量的问题。我们研究了从简单累积奖励到基于学习价值的估计器等多种代理指标,并引入了Bellman Wasserstein距离(BWD),这是一种价值感知的optimal transport评分,衡量数据集行为策略与随机参考策略之间的不似合性。BWD通过行为批评家和状态条件OT公式计算,无需环境交互或完整的策略优化。在D4RL MuJoCo任务上,BWD与聚合了多个离线RL算法的oracle绩效分数高度相关,能够高效预测标准智能体在给定数据集上的表现。除了预测之外,将BWD作为正则化项集成到策略优化中,可显式地将学习到的策略从随机行为中推开并提高回报。这些结果表明,诸如BWD等价值感知、分布性信号是实用的数据集和策略优化 triage工具的有效方法。

关键词

引用

@article{arxiv.2510.12638,
  title  = {Expert or not? assessing data quality in offline reinforcement learning},
  author = {Arip Asadulaev and Fakhri Karray and Martin Takac},
  journal= {arXiv preprint arXiv:2510.12638},
  year   = {2025}
}