SWE-bench多模态:AI系统能否泛化到视觉软件领域?
计算与语言
2024-10-08 v1 人工智能
软件工程
摘要
软件工程的自主系统现在能够修复错误和开发功能。这些系统通常通过SWE-bench(Jimenez等人,2024a)进行评估,该基准测试评估它们解决来自GitHub仓库的软件问题的能力。然而,SWE-bench仅使用Python仓库,问题陈述主要以文本形式呈现,缺乏图像等视觉元素。这种有限的覆盖范围促使我们探究现有系统在未代表的软件工程领域(例如前端、游戏开发、DevOps)中可能的表现,这些领域使用不同的编程语言和范式。因此,我们提出了SWE-bench多模态(SWE-bench M),用于评估系统修复视觉、面向用户的JavaScript软件中错误的能力。SWE-bench M包含从17个用于网页界面设计、图表绘制、数据可视化、语法高亮和交互式地图绘制的JavaScript库中收集的617个任务实例。每个SWE-bench M任务实例在其问题陈述或单元测试中至少包含一张图像。我们的分析发现,表现最佳的SWE-bench系统在SWE-bench M上表现不佳,揭示了在视觉问题解决和跨语言泛化方面的局限性。最后,我们表明SWE-agent灵活的语言无关特性使其在SWE-bench M上显著优于其他替代方案,解决了12%的任务实例,而次优系统仅解决了6%。
引用
@article{arxiv.2410.03859,
title = {SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?},
author = {John Yang and Carlos E. Jimenez and Alex L. Zhang and Kilian Lieret and Joyce Yang and Xindi Wu and Ori Press and Niklas Muennighoff and Gabriel Synnaeve and Karthik R. Narasimhan and Diyi Yang and Sida I. Wang and Ofir Press},
journal= {arXiv preprint arXiv:2410.03859},
year = {2024}
}