通过熵增强多轮偏好优化构建编码智能体
人工智能
2026-02-05 v3
摘要
软件工程为大型语言模型 (LLM) 带来了复杂的多步骤挑战,需要在大型代码库上进行推理并协调工具使用。SWE-bench 等基准测试体现了这些任务的难度,当前 LLM 仍难以解决现实世界的问题。提升性能的一个有前景方法是测试时扩展 (TTS),但其收益严重依赖于模型输出的多样性。虽然诸如直接偏好优化 (DPO) 和 Kahneman-Tversky 优化 (KTO) 等标准对齐方法能有效将模型输出与人类偏好对齐,但这一过程可能以牺牲多样性为代价,从而限制了 TTS 的有效性。此外,现有的偏好优化算法通常为单轮任务设计,未能充分解决交互式编码智能体所需的多轮推理和工具集成的复杂性。为了弥合这一差距,我们引入了 EntroPO,这是一个熵增强框架,将现有的偏好优化算法适配到多轮、工具辅助的设置中。EntroPO 增强了偏好目标以显式保留策略熵,并将学习推广至优化多轮交互而非单轮响应。我们通过微调来自不同家族和规模(高达 106B 参数)的多种模型来验证 EntroPO。为了最大化 TTS 带来的性能增益,我们进一步提出了一种结合学习型验证器模型与无模型方法的混合最佳轨迹选择方案。在 SWEBENCH 排行榜上,我们的方法在开放权重模型中确立了新的 SOTA 结果。使用 EntroPO 训练的 30B 参数模型在开放权重排行榜上于 SWEBENCH-LITE 排名第一,在 SWEBENCH-VERIFIED 排名第四,仅被参数量超过其 10 倍以上的模型(例如 >)超越。
引用
@article{arxiv.2509.12434,
title = {Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization},
author = {Jiahao Yu and Zelei Cheng and Xian Wu and Xinyu Xing},
journal= {arXiv preprint arXiv:2509.12434},
year = {2026}
}