中文

记忆增强的动态奖励塑形

机器学习 2026-04-14 v1 人工智能 计算与语言

摘要

尽管强化学习在大型语言模型中取得了成功,但常见的失败模式是采样多样性下降,即策略反复生成类似的错误行为。经典的熵正则化方法在当前策略下鼓励随机性,但并不明确抑制跨 rollout 的反复错误模式。我们提出了 MEDS,即记忆增强的动态奖励塑形框架,通过整合历史行为信号到奖励设计中。通过存储和利用中间模型表示,我们捕获过去 rollout 的特征,并采用基于密度的聚类识别频繁出现的错误模式。分配给更常见错误簇的 rollout 将受到更重的惩罚,从而鼓励更广泛的探索并减少重复错误。在五个数据集和三个基础模型上,MEDS 相对于现有基线始终实现平均性能提升,最高可达 4.13 个 pass@1 分数和 4.37 个 pass@128 分数。额外的分析通过 LLM 标注和定性多样性指标显示,MEDS 在采样期间增加了行为多样性。

关键词

引用

@article{arxiv.2604.11297,
  title  = {The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping},
  author = {Yang Liu and Enxi Wang and Yufei Gao and Weixin Zhang and Bo Wang and Zhiyuan Zeng and Yikai Zhang and Yining Zheng and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2604.11297},
  year   = {2026}
}