DRAGON:针对大型软件仓库进行鲁棒分类
软件工程
2026-02-11 v1 人工智能
机器学习
摘要
自动对源代码仓库进行以内容和用途为导向的“主题”分类的能力在浏览或搜索大型软件集合时非常有用。然而,现有方法常常依赖README文件和其他元数据,而这些文件经常缺失,限制了其在实际大规模场景中的适用性。我们提出DRAGON,一个为非常大且多样化的软件集合设计的分类器。它完全基于版本控制系统中常见的轻量级信号运行:文件和目录名称,以及可选的README文件。 在大规模的仓库分类中,DRAGON将F1@5从54.8%提高到60.8%,超越了当前最先进的技术。即使在README文件缺失的情况下,DRAGON仍然有效,性能仅比README文件存在时下降约6%。这种鲁棒性使其在实际场景中具有实用性,其中文档稀缺或不一致。此外,许多剩余的分类错误都是接近 miss,其中预测的标签与正确主题在语义上非常接近。这一属性增加了在实际软件集合中对预测在实际价值,其中建议几个相关主题仍然可以指导搜索和发现。作为开发DRAGON的副产品,我们也发布了目前为止规模最大的面向仓库分类的开放数据集,包含82.5万个仓库,配有相关的ground-truth主题,来自Software Heritage档案馆,为未来的大规模和语言无关的软件仓库理解研究提供了基础。
引用
@article{arxiv.2602.09071,
title = {DRAGON: Robust Classification for Very Large Collections of Software Repositories},
author = {Stefano Balla and Stefano Zacchiroli and Thomas Degueule and Jean-Rémy Falleri and Romain Robbes},
journal= {arXiv preprint arXiv:2602.09071},
year = {2026}
}