基于 LLM 的 GitHub 仓库内容分类方法——基于 README 文件
人工智能
2025-07-30 v1 机器学习
软件工程
摘要
GitHub 是全球最流行的存储、共享和管理代码的平台。每个 GitHub 仓库都有一个与之关联的 README 文件。README 文件应包含项目相关信息,以支持仓库的使用和改进。然而,GitHub 仓库的所有者有时会忽视这些建议。这会阻止 GitHub 仓库发挥其全部潜力。本研究认为,GitHub 仓库 README 文件的完整性显著影响其采纳和利用,缺乏细节可能阻碍其在研究社区中获得广泛参与和影响。大型语言模型(LLM)在许多基于文本的任务中表现出色,包括文本分类、文本生成、文本摘要和文本翻译。在本研究中,我们开发了一种基于 LLM 的方法,用于自动对 GitHub README 文件的不同部分进行分类。我们利用 BERT、DistilBERT 和 RoBERTa 等三个仅编码器 LLM。然后,我们基于由 4226 条 README 文件部分组成的黄金标准数据集对这些预训练模型进行微调。该方法超越了当前的最先进方法,实现了整体 F1 分数为 0.98。此外,我们还研究了参数高效微调(PEFT)技术如 LoRA 的使用,并展示了在不显著牺牲性能方面的经济实惠替代方案。结果表明,利用 LLM 设计用于对 GitHub README 文件内容进行自动分类的潜力巨大。因此,本研究为开发自动化工具以提高 GitHub 仓库识别和潜在用途提供了贡献。
引用
@article{arxiv.2507.21899,
title = {LLM-based Content Classification Approach for GitHub Repositories by the README Files},
author = {Malik Uzair Mehmood and Shahid Hussain and Wen Li Wang and Muhammad Usama Malik},
journal= {arXiv preprint arXiv:2507.21899},
year = {2025}
}
备注
8 pages, 4 Figures