中文

通过率能说明一切吗?评估基于LLM的问题解决中的设计约束合规性

软件工程 2026-04-08 v1 人工智能

摘要

仓库级问题解决基准已成为评估基于LLM的智能体的标准测试平台,然而成功与否仍主要通过测试通过率来衡量。然而在实践中,可接受的补丁还必须符合项目特定的设计约束,例如架构约定、错误处理策略和可维护性要求,这些约束很少被编码在测试中,并且通常仅在代码审查讨论中被隐式记录。本文引入了\textit{设计感知的问题解决},并提出了\bench{}基准,该基准使此类隐式设计约束变得明确且可测量。\bench{}通过从真实世界的拉取请求中挖掘和验证设计约束,将其链接到问题实例,并使用基于LLM的验证器自动检查补丁合规性来构建,在六个仓库中产生了495个问题和1,787个经过验证的约束,与SWE-bench-Verified和SWE-bench-Pro保持一致。使用最先进智能体的实验表明,基于测试的正确性显著高估了补丁质量:不到一半的已解决问题完全满足设计,设计违规普遍存在,并且功能正确性与设计满意度之间几乎没有统计关联。虽然提供针对问题的设计指导减少了违规,但仍有大量不合规情况,这凸显了当前智能体能力的根本差距,并激励了超越功能正确性的设计感知评估。

关键词

引用

@article{arxiv.2604.05955,
  title  = {Does Pass Rate Tell the Whole Story? Evaluating Design Constraint Compliance in LLM-based Issue Resolution},
  author = {Kai Yu and Zhenhao Zhou and Junhao Zeng and Ying Wang and Xueying Du and Zhiqiang Yuan and Junwei Liu and Ziyu Zhou and Yujia Wang and Chong Wang and Xin Peng},
  journal= {arXiv preprint arXiv:2604.05955},
  year   = {2026}
}