面向离线强化学习的轨迹级数据增强
机器学习
2026-05-14 v1 机器人学
机器学习
摘要
我们提出了一种针对离线强化学习的数据增强方法,灵感来自主动定位问题。特别地,我们的方法使能够从有限数量的次优轨迹中训练离策略模型。我们引入一种基于轨迹的数据增强技术,利用任务结构和奖励、价值函数与日志策略数学性质之间的几何关系。在数据收集期间,我们的增强支持次优日志策略,导致更高的数据质量和 improved 的离线强化学习性能。我们对这些策略提供了理论依据,并在不同维度和部分可观测性下的定位任务中进行了经验验证。
引用
@article{arxiv.2605.13401,
title = {Trajectory-Level Data Augmentation for Offline Reinforcement Learning},
author = {Tobias Schmähling and Matthias Burkhardt and Tobias Windisch},
journal= {arXiv preprint arXiv:2605.13401},
year = {2026}
}
备注
26 pages, 25 figures, Accepted at ICML 2026