中文

UFO-RL:基于不确定性的强化学习数据选择高效优化

机器学习 2025-05-20 v1 计算与语言

摘要

规模化 LLM 强化学习计算成本高昂,主要因策略优化和评估需要多次抽样,使得高效数据选择至关重要。灵感来自最近的 proximal 开发区(ZPD)理论,我们假设 LLM 最佳来自其潜在理解区域的数据学习。针对常规计算密集型多抽样方法用于数据评估的局限,本文引入 UFO-RL。该新型框架使用计算高效的单遍不确定性估计来识别有信息量的数据实例,实现数据评估速度提升最高可达 185 倍。UFO-RL 利用此指标选择估计内的 ZPD 数据进行训练。实验表明,使用 UFO-RL 选择的仅 10% 数据进行训练,即可实现与完整数据训练相当或更好的性能,同时将整体训练时间缩短最高可达 16 倍,并提升稳定性和泛化能力。UFO-RL 提供了一种实用且高度高效的策略,用于通过聚焦于有价值数据来扩展 LLM 强化学习微调。

关键词

引用

@article{arxiv.2505.12457,
  title  = {UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection},
  author = {Yang Zhao and Kai Xiong and Xiao Ding and Li Du and YangouOuyang and Zhouhao Sun and Jiannan Guan and Wenbin Zhang and Bin Liu and Dong Hu and Bing Qin and Ting Liu},
  journal= {arXiv preprint arXiv:2505.12457},
  year   = {2025}
}