中文

训练数据教授 RL 记忆代理:记忆增强 QA 中课程效应的实证研究

计算与语言 2026-05-25 v1

摘要

强化学习 (RL) 已成为训练 LLM 代理以在多轮对话中处理外部记忆库的可行方法。现有工作仅在单个基准上训练,留下了训练数据的组成如何塑造记忆代理获取技能的悬而未决问题。我们提出了一项受控实证研究,固定架构、RL 算法和所有超参数,仅变更训练课程,包含三种条件:领域内 (LoCoMo)、混合基准 (LoCoMo + LongMemEval) 和领域外 (仅 LongMemEval)。在两个基准和十种问题类型中,课程组合作为对专业化的细粒度杠杆,而非对性能的均匀缩放因子。混合课程在两个评估集上实现最强的整体 F1 分数。仅在狭窄领域外集合上训练可转移特定技能——时间推理——尽管整体绩效较弱。按类型差异显著超过整体差异,表明单一数字基准比较系统性地低报了课程效应。我们进一步报告了将 GRPO 适用于单 GPU regime 的两个实用经验教训:跨基准混合需要过滤记忆库中与格式相关的噪声以保留训练信号,二进制精确匹配奖励在所需的单 GPU 小组规模 (G=4) 下产生 no learning signal,动机是该 regime 下的连续奖励函数。

关键词

引用

@article{arxiv.2605.23067,
  title  = {What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA},
  author = {Xinjie He and Zhiyuan Lin and Su Liu and Jialun Wu and Qiyang Xie and Weikai Zhou and Shuai Xiao},
  journal= {arXiv preprint arXiv:2605.23067},
  year   = {2026}
}

备注

14 pages, 2 figures, 11 tables. Code, checkpoints, and evaluation artifacts available at https://github.com/EvaxHe/rl-memory-curriculum