离线强化学习中用于数据集选择的数据质量度量
机器学习
2021-11-29 v1
摘要
最近开发的离线强化学习算法使得直接从预先收集的数据集中学习策略成为可能,这给从业者带来了一个新的困境:由于算法能够提供的性能在很大程度上取决于提供给它们的数据集,从业者需要在可用数据集中挑选出正确的数据集。到目前为止,相关文献尚未讨论过这一问题。我们讨论了如何选择有前景的数据集的想法,并提出了三个非常简单的指标:估计相对回报提升(ERI)、估计动作随机性(EAS)以及两者的组合(COI),并经验性地表明,尽管它们很简单,但可以非常有效地用于数据集选择。
引用
@article{arxiv.2111.13461,
title = {Measuring Data Quality for Dataset Selection in Offline Reinforcement Learning},
author = {Phillip Swazinna and Steffen Udluft and Thomas Runkler},
journal= {arXiv preprint arXiv:2111.13461},
year = {2021}
}
备注
Accepted at IEEE SSCI 2021