中文

面向强化学习编码智能体的反馈归一化开发者记忆:一种安全加盖的 MCP 架构

人工智能 2026-05-05 v1

摘要

大型语言模型(LLM)编码智能体日益越过仓库、终端、测试和执行痕迹,在持续的软件工程情节中运行。持久记忆有用,但静态向量存储或通用检索增强生成(RAG)对于强化学习(RL)代码开发不够,因为细微差异会改变 Bellman 目标、终端掩码、梯度流动或验证主张。本文提出了 RL 开发者记忆,这是一种本地优先、模型上下文协议(MCP)原生的开发者记忆架构,专为 RL 编码智能体设计。它将记忆选择作为已记录的上下文决策过程来处理:issue_match 对候选对象进行排序并记录遥测数据,issue_feedback 将原始标签映射到有界奖励,issue_record_resolution 将已验证的解决方案链接到早期检索事件。一种确定性排序器继续部署,而一种情境性 bandit 残差策略在影子模式下运行,只能通过保守的离策略评估(OPE)闸门影响 canary 行为。RL/控制记忆需要理论到代码的元数据和审查加盖的治理。该系统在一个确定性的 200 案例基准上进行评估,包括 RL 算法错误、硬负例、审查加盖的 RL/控制案例以及低风险失败。在相同的提交比较中,确定性控制和完整影子/OPE 都实现了 80.0% 的预期决策准确率和 100.0% 的硬负例抑制;完整配置添加了学习遥测数据而非准确率提升。静态验证通过了 11/11 项检查;动态集成通过了 10/10 项案例。该证据报告了限制:主动部署已学习的策略和官方客户 MCP 互操作性不受支持,完整配置的延迟回归,以及 40 项残余非 RL 失败。该工作的贡献是具备明确主张边界的可审计记忆控制架构,而非通用的编码智能体改进主张。

关键词

引用

@article{arxiv.2605.01566,
  title  = {Multi-Agent Reasoning Improves Compute Efficiency: Pareto-Optimal Test-Time Scaling},
  author = {Florian Valentin Wunderlich and Lars Benedikt Kaesberg and Jan Philip Wahle and Terry Ruas and Bela Gipp},
  journal= {arXiv preprint arXiv:2605.01566},
  year   = {2026}
}

备注

Accepted at SRW at ACL 2026, long paper