打破僵局:面向社交语言代理的双尺度演化策略训练
计算与语言
2026-05-12 v1
摘要
虽然基于可验证奖励的强化学习(RLVR)在封闭端任务中效果显著,但将其扩展到通过自我对弈的开放式社交语言游戏时,存在一个关键问题:演化僵局。由于策略空间庞大,语言代理频繁收敛到均匀化行为,导致确定性比赛结果,这消除了策略演化所必需的梯度信号。为解决此问题,我们提出双尺度演化策略训练(DEPT)用于社交语言游戏。DEPT引入时间尺度的演化感知机制,通过量化双尺度价值基线发散度和比赛熵来检测僵局。 Upon检测到僵局后,它会激活非对称的优势重塑,以动态调节优化景观进行干预。因此,我们的方法有效恢复了梯度信号并强制持续的战略探索。大量实验表明,DEPT在多个社交语言游戏上优于强基线,避免了策略退化并推动了社交语言代理的持续演化。
引用
@article{arxiv.2605.08721,
title = {Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents},
author = {Minzheng Wang and Run Luo and Yanbo Wang and Zichen Liu and Yuqiao Tan and Tao Tan and Xu Nan and Yinhe Zheng and Wenji Mao},
journal= {arXiv preprint arXiv:2605.08721},
year = {2026}
}
备注
Accepted to the ACL 2026 Main Conference