中文

基于信息增益最大化的多保真混合强化学习

机器学习 2025-09-19 v1 信号处理

摘要

强化学习(RL)策略的优化通常需要与高保真环境模拟器进行大量交互,而这往往成本高昂或不可行。离线RL通过允许使用预收集的数据进行训练来解决此问题,但其有效性严重受限于数据集的规模和质量。混合离线-在线RL利用离线数据和与单一环境模拟器的交互。然而在许多实际场景中,可获得多个保真度不同的模拟器。本文研究在固定成本预算下的多保真混合RL。我们引入基于信息增益最大化的多保真混合RL(MF-HRL-IGM),一种通过自举方法实现保真度选择的混合离线-在线RL算法。理论分析表明MF-HRL-IGM具有无损失属性,而实证评估表明其性能优于现有基准方法。

关键词

引用

@article{arxiv.2509.14848,
  title  = {Multi-Fidelity Hybrid Reinforcement Learning via Information Gain Maximization},
  author = {Houssem Sifaou and Osvaldo Simeone},
  journal= {arXiv preprint arXiv:2509.14848},
  year   = {2025}
}