基于编译器和语言服务器反馈的强化学习
计算与语言
2026-05-05 v2 人工智能
编程语言
软件工程
摘要
编码代理在文本层面的猜测超过程序事实时会失败:它们会幻觉API、偏离正确符号,并在工作区有效性无据可循的情况下应用编辑。编译器、类型检查器和语言服务器已经计算了缺失的监督信号,其形式为诊断信息、符号解析、类型信息、引用和重构前置条件,但其接口是为人类驱动的IDE而非学习循环而设计的。我们引入基于编译器和语言服务器反馈的强化学习(RLCSF),并配合Lanser-CLI,一种面向代理和CI的CLI优先编排层,暴露这些信号。RLCSF将每一次工具交互视为一次状态转移,并从诊断、选择器置信度和编辑安全性的确定性变化中计算加权过程奖励。Lanser-CLI则将短暂的LSP会话转换为具有固定环境元数据和稳定内容哈希的可回放分析捆绑包。其核心机制包括超越file:line:col的鲁棒选择器、确定性捆绑规范化、预览优先受保护的变更,以及在冻结快照下可回放的奖励函数,其潜在分量组件具有可重现性。我们为标准化捆绑包 formaliz determinism,并证明在无折扣设定下,组件逐步改进的转移获得非负奖励。这些组件共同构成了用于过程监督的编码代理的实用基座。
引用
@article{arxiv.2510.22907,
title = {Reinforcement Learning from Compiler and Language Server Feedback},
author = {Yifan Zhang and Lanser Contributors},
journal= {arXiv preprint arXiv:2510.22907},
year = {2026}
}
备注
Project Page: https://github.com/yifanzhang-pro/lanser-cli