中文

EntroPIC:通过熵稳定控制实现 LLM 长期训练的稳定性

机器学习 2026-02-03 v2 人工智能

摘要

大语言模型(LLM)的长期训练需要维持稳定的探索以防止模型坍缩为亚最优行为。熵在此上下文中至关重要,因为它控制探索并帮助避免过早收敛到亚最优解。然而,现有的强化学习方法难以维持适当的熵水平,因为训练过程中正负样本的混合会在不同步骤中以不同方式影响熵。为此,我们提出一种通过比例-积分控制实现熵稳定的 EntroPIC 方法,通过动态调节正负样本的损失系数来适应性地调整其影响。这一方法在整个训练过程中稳定熵,确保高效探索和持续进展。我们提供了针对 on-policy 和 off-policy 学习情境的全面理论分析,表明 EntroPIC 在大规模 LLM 训练中有效控制熵。实验结果表明,我们的方法成功维持了所需的熵水平,实现了 LLM 长期稳定且最优的强化学习训练。

关键词

引用

@article{arxiv.2511.15248,
  title  = {EntroPIC: Towards Stable Long-Term Training of LLMs via Entropy Stabilization with Proportional-Integral Control},
  author = {Kai Yang and Xin Xu and Yangkun Chen and Weijie Liu and Jiafei Lyu and Zichuan Lin and Deheng Ye and Saiyong Yang},
  journal= {arXiv preprint arXiv:2511.15248},
  year   = {2026}
}