中文

如何微调模型:统一模型偏移与模型偏差的策略优化

机器学习 2023-10-25 v2 人工智能

摘要

设计并推导具有性能提升保证的有效基于模型的强化学习(MBRL)算法具有挑战性,主要归因于模型学习与策略优化之间的高度耦合。许多先前依赖回报差异来指导模型学习的方法忽略了模型偏移的影响,可能因过度的模型更新导致性能退化。其他方法利用性能差异界显式考虑模型偏移,但这些方法依赖固定阈值来约束模型偏移,导致对阈值的严重依赖及训练过程中缺乏适应性。本文从理论上推导了一个能统一模型偏移与模型偏差的优化目标,并由此形式化了一个微调过程。该过程自适应调整模型更新以获得性能提升保证,同时避免模型过拟合。基于此,我们开发了一个简洁的算法 USB-PO(Unified model Shift and model Bias Policy Optimization)。实证结果表明,USB-PO 在多个具有挑战性的基准任务上取得了 state-of-the-art 性能。

关键词

引用

@article{arxiv.2309.12671,
  title  = {How to Fine-tune the Model: Unified Model Shift and Model Bias Policy Optimization},
  author = {Hai Zhang and Hang Yu and Junqiao Zhao and Di Zhang and Chang Huang and Hongtu Zhou and Xiao Zhang and Chen Ye},
  journal= {arXiv preprint arXiv:2309.12671},
  year   = {2023}
}