CoDocBench:面向软件维护的代码-文档对齐数据集
软件工程
2025-02-05 v2 机器学习
摘要
软件维护的核心任务之一是理解和开发代码变更。因此,给定函数的自然语言描述所需的新操作,可能被要求生成实现该新操作的编辑集合;反之,给定函数的编辑集合,可能被要求生成该函数新功能的描述。因此,培训神经模型以解决此类变更相关任务具有诱因。为此,我们提供了一个新的、来自实际高质量 GitHub 项目的大型“自然”代码和文档配对数据集,其中每个样本代表单次提交,代码和关联文档一起更改。我们介绍收集数据集的方法,并提供一些样本、具有挑战性(但真实)的任务,其中我们的atasets 为学习和评估提供了机会。我们发现当前模型(具体包括 Llama-3.1 405B、Mixtral 8×22B)在这些维护相关任务方面仍具挑战性。
引用
@article{arxiv.2502.00519,
title = {CoDocBench: A Dataset for Code-Documentation Alignment in Software Maintenance},
author = {Kunal Pai and Premkumar Devanbu and Toufique Ahmed},
journal= {arXiv preprint arXiv:2502.00519},
year = {2025}
}
备注
Accepted at the 2025 IEEE/ACM 22nd International Conference on Mining Software Repositories (MSR) - Data and Tool Showcase Track