中文

面向离线强化学习的轨迹级数据增强

机器学习 2026-05-14 v1 机器人学 机器学习

摘要

我们提出了一种针对离线强化学习的数据增强方法,灵感来自主动定位问题。特别地,我们的方法使能够从有限数量的次优轨迹中训练离策略模型。我们引入一种基于轨迹的数据增强技术,利用任务结构和奖励、价值函数与日志策略数学性质之间的几何关系。在数据收集期间,我们的增强支持次优日志策略,导致更高的数据质量和 improved 的离线强化学习性能。我们对这些策略提供了理论依据,并在不同维度和部分可观测性下的定位任务中进行了经验验证。

关键词

引用

@article{arxiv.2605.13401,
  title  = {Trajectory-Level Data Augmentation for Offline Reinforcement Learning},
  author = {Tobias Schmähling and Matthias Burkhardt and Tobias Windisch},
  journal= {arXiv preprint arXiv:2605.13401},
  year   = {2026}
}

备注

26 pages, 25 figures, Accepted at ICML 2026