中文

策略分裂:基于双模式熵正则化的 LLM 强化学习中的双模式探索激励机制

计算与语言 2026-04-14 v1 人工智能 机器学习

摘要

为在不牺牲准确性的前提下鼓励大语言模型 (LLM) 强化学习中的多样化探索,我们提出了策略分裂 (Policy Split)——一种新颖的范式,通过高熵提示将策略分为正常模式和高熵模式。虽然两者共享模型参数,但两种模式针对不同目标进行合作式双模式熵正则化。具体而言,正常模式优化任务正确性,而高熵模式则纳入对探索的偏好,两者协同学习。大量实验表明,在一般任务和创意任务中,本方法在各种模型规模下均持续优于现有的基于熵引导的强化学习基线。进一步分析显示,策略分裂促进了双模式探索,其中高熵模式生成与正常模式具有不同行为模式,为模型提供独特的学习信号。

关键词

引用

@article{arxiv.2604.11510,
  title  = {Policy Split: Incentivizing Dual-Mode Exploration in LLM Reinforcement with Dual-Mode Entropy Regularization},
  author = {Jiashu Yao and Heyan Huang and Chuwei Luo and Daiqing Wu and Zeming Liu and Yuhang Guo and Yangyang Kang},
  journal= {arXiv preprint arXiv:2604.11510},
  year   = {2026}
}

备注

preprint