中文

CodeV:基于视觉数据的问题解决

软件工程 2024-12-24 v1 人工智能 计算与语言

摘要

大型语言模型(LLMs)近年来迅速发展,其在软件工程中的应用正在扩展到更复杂的仓库级任务。GitHub问题解决是其中关键挑战。虽然最近的研究方法在这方面取得了进展,但它们关注问题中的文本数据,忽略了视觉数据。然而,这些视觉数据对于解决问题至关重要,因为它传递了文本alone 无法传递的额外知识。我们提出CodeV,首次利用视觉数据来增强LLMs的问题解决能力。CodeV通过两个阶段解决每个问题:数据处理和补丁生成。为评估CodeV,我们构建了一个用于视觉问题解决的基准数据集,即Visual SWE-bench。通过大量实验,我们展示了CodeV的有效性,并为利用视觉数据解决GitHub问题提供了宝贵的见解。

关键词

引用

@article{arxiv.2412.17315,
  title  = {CodeV: Issue Resolving with Visual Data},
  author = {Linhao Zhang and Daoguang Zan and Quanshun Yang and Zhirong Huang and Dong Chen and Bo Shen and Tianyu Liu and Yongshun Gong and Pengjie Huang and Xudong Lu and Guangtai Liang and Lizhen Cui and Qianxiang Wang},
  journal= {arXiv preprint arXiv:2412.17315},
  year   = {2024}
}

备注

https://github.com/luolin101/CodeV