中文

基于熵的序列加权用于强化学习中的LLM微调高效探索

机器学习 2025-04-01 v2 人工智能

摘要

我们提出熵导序列加权(Entropy-Guided Sequence Weighting, EGSW),一种新颖方法,通过动态为强化学习基于的大语言模型微调分配生成输出的权重,以其优势和熵为依据。EGSW将熵正则化与基于优势的加权相结合,以平衡策略更新,实现高维状态空间中高效探索。通过对序列采用温度缩放的softmax加权,EGSW优先选择高奖励、高不确定性的步骤,同时保持训练稳定性。虽然该方法最初是为了提高基于组相对政策优化(Group Relative Policy Optimization, GRPO)的大语言模型微调而开发,但EGSW可推广到其他强化学习(RL)算法,并可在步级和轨迹级设置中实现。经验评估表明,EGSW提高了GRPO的推理能力,显著提升了样本效率。未来工作将探索将EGSW应用于先进RL方法的可能性。

关键词

引用

@article{arxiv.2503.22456,
  title  = {Entropy-guided sequence weighting for efficient exploration in RL-based LLM fine-tuning},
  author = {Abdullah Vanlioglu},
  journal= {arXiv preprint arXiv:2503.22456},
  year   = {2025}
}