中文

Fine-Mem:面向长程记忆管理的细粒度反馈对齐

计算与语言 2026-01-14 v1

摘要

有效的记忆管理对于大型语言模型智能体执行长程任务至关重要。近期研究探索了利用强化学习来开发专门的记忆管理智能体。然而,现有方法依赖最终任务表现作为主要奖励,这导致严重的奖励稀疏和无效的信用分配,无法为单个记忆操作提供充分指导。为此,我们提出了 Fine-Mem,一个专为细粒度反馈对齐设计的统一框架。首先,我们引入了块级步奖励,通过辅助的特定块问答任务提供即时的步级监督。其次,我们设计了证据锚定奖励归因,基于推理中用作证据的具体记忆项,将信用锚定至关键记忆操作,从而重新分配全局奖励。这些组件共同实现了稳定的策略优化,并将局部记忆操作与记忆的长期效用相对齐。在 Memalpha 和 MemoryAgentBench 上的实验表明,Fine-Mem 始终优于强基线,在各类子任务中取得了更高的成功率。进一步分析揭示了其在不同模型配置和骨干网络中的适应性和强泛化能力。

关键词

引用

@article{arxiv.2601.08435,
  title  = {Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management},
  author = {Weitao Ma and Xiaocheng Feng and Lei Huang and Xiachong Feng and Zhanyu Ma and Jun Xu and Jiuchong Gao and Jinghua Hao and Renqing He and Bing Qin},
  journal= {arXiv preprint arXiv:2601.08435},
  year   = {2026}
}

备注

18 pages, 5 figures