SWE-chat:来自真实用户的编码智能体交互
人工智能
2026-04-23 v1 计算机与社会
软件工程
摘要
AI 编码智能体正在大规模被采用,但我们缺乏关于人们实际如何使用它们以及其输出在实践中有多大用处的经验证据。我们提出了 SWE-chat,这是第一个从开源开发者中收集的大规模真实编码智能体会话数据集。该数据集目前包含 6000 个会话,包括超过 63000 条用户提示和 355000 次智能体工具调用。SWE-chat 是一个活数据集;我们的收集管道会自动且持续地从公共仓库中发现并处理会话。利用 SWE-chat,我们对真实世界编码智能体的使用和失败模式进行了初步的经验性描述。我们发现编码模式是双峰的:在 41% 的会话中,智能体编写了几乎所有提交的代码(“氛围编码”),而在 23% 的会话中,人类自己编写了所有代码。尽管能力在迅速提升,但编码智能体在自然环境中仍然效率低下。所有智能体生成的代码中只有 44% 最终进入用户提交,并且智能体编写的代码比人类编写的代码引入了更多的安全漏洞。此外,用户在 44% 的轮次中通过纠正、失败报告和中断来抵制智能体的输出。通过捕获带有代码作者归属(人类 vs. 智能体)的完整交互轨迹,SWE-chat 为超越精心策划的基准测试,走向对 AI 智能体在真实开发者工作流中表现的循证理解提供了经验基础。
引用
@article{arxiv.2604.20779,
title = {SWE-chat: Coding Agent Interactions From Real Users in the Wild},
author = {Joachim Baumann and Vishakh Padmakumar and Xiang Li and John Yang and Diyi Yang and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2604.20779},
year = {2026}
}