中文

打破僵局:面向社交语言代理的双尺度演化策略训练

计算与语言 2026-05-12 v1

摘要

虽然基于可验证奖励的强化学习(RLVR)在封闭端任务中效果显著,但将其扩展到通过自我对弈的开放式社交语言游戏时,存在一个关键问题:演化僵局。由于策略空间庞大,语言代理频繁收敛到均匀化行为,导致确定性比赛结果,这消除了策略演化所必需的梯度信号。为解决此问题,我们提出双尺度演化策略训练(DEPT)用于社交语言游戏。DEPT引入时间尺度的演化感知机制,通过量化双尺度价值基线发散度和比赛熵来检测僵局。 Upon检测到僵局后,它会激活非对称的优势重塑,以动态调节优化景观进行干预。因此,我们的方法有效恢复了梯度信号并强制持续的战略探索。大量实验表明,DEPT在多个社交语言游戏上优于强基线,避免了策略退化并推动了社交语言代理的持续演化。

关键词

引用

@article{arxiv.2605.08721,
  title  = {Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents},
  author = {Minzheng Wang and Run Luo and Yanbo Wang and Zichen Liu and Yuqiao Tan and Tao Tan and Xu Nan and Yinhe Zheng and Wenji Mao},
  journal= {arXiv preprint arXiv:2605.08721},
  year   = {2026}
}

备注

Accepted to the ACL 2026 Main Conference