中文

Ambig-SWE:交互式智能体克服软件工程中的不明确性

人工智能 2026-02-24 v3

摘要

AI 智能体正越来越多地被部署用于自动化任务,通常基于不明确的用户指令。为弥补缺失信息而做出无依据的假设,以及未能提出澄清性问题,都可能导致次优结果、工具误用带来的安全风险以及计算资源的浪费。在本工作中,我们研究了 LLM 智能体在交互式代码生成设置中处理不明确指令的能力,通过在三个关键步骤上评估专有模型和开源模型的性能:(a) 检测不明确性,(b) 提出有针对性的澄清性问题,(c) 利用交互来改善不明确场景下的表现。我们引入了 Ambig-SWE——一个专门为评估智能体在模糊性和交互下的行为而设计的不明确变体 SWE-Bench Verified。我们的发现表明,模型难以区分明确指令和不明确指令。然而,当模型针对不明确输入进行交互时,它们能有效从用户处获取关键信息,从而使性能显著提升,在非交互式设置上最高提升 74%,凸显了有效交互的价值。本研究揭示了当前最先进模型在处理复杂软件工程任务中缺失信息方面的关键差距,并将评估结构化为独立步骤以实现针对性改进。

关键词

引用

@article{arxiv.2502.13069,
  title  = {Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering},
  author = {Sanidhya Vijayvargiya and Xuhui Zhou and Akhila Yerukola and Maarten Sap and Graham Neubig},
  journal= {arXiv preprint arXiv:2502.13069},
  year   = {2026}
}

备注

22 pages, 7 figures, Accepted at ICLR 2026