中文

LEGION:利用预训练语言模型与分布均衡损失进行 GitHub 主题推荐

软件工程 2024-03-12 v1 信息检索 机器学习

摘要

开源开发通过促进协作、透明度和社区驱动的创新,彻底改变了软件行业。如今,大量各种各样的开源软件形成了仓库网络,通常托管在 GitHub 这一流行的软件开发平台上。为了提高仓库网络(即相似仓库组)的可发现性,GitHub 在 2017 年引入了仓库主题,使用户能够更轻松地按类型、技术等探索相关项目。因此,准确地为每个 GitHub 仓库分配主题至关重要。当前自动主题推荐的方法严重依赖 TF-IDF 来编码文本数据,在理解语义细微差别方面存在挑战。本文通过提出 Legion 来解决现有技术的局限性,这是一种利用预训练语言模型为 GitHub 仓库推荐主题的新方法。Legion 的关键创新之处有三点。首先,Legion 利用 PTM 在语言理解方面的广泛能力来捕获 GitHub 仓库中的上下文信息和语义含义。其次,Legion 通过提出分布均衡损失来更好地训练 PTM,从而克服了导致 PTM 偏向热门主题的长尾分布挑战。第三,Legion 采用过滤器消除模糊推荐,从而提高了 PTM 的精度。我们在真实世界 GitHub 仓库的基准数据集上的实证评估表明,Legion 在推荐 GitHub 主题方面可以使普通 PTM 提高多达 26%。在 Precision 和 F1-score 方面,Legison 还能比 SOTA 基线更精确、更有效地推荐 GitHub 主题,平均分别提高 20% 和 5%。

关键词

引用

@article{arxiv.2403.05873,
  title  = {LEGION: Harnessing Pre-trained Language Models for GitHub Topic Recommendations with Distribution-Balance Loss},
  author = {Yen-Trang Dang and Thanh-Le Cong and Phuc-Thanh Nguyen and Anh M. T. Bui and Phuong T. Nguyen and Bach Le and Quyet-Thang Huynh},
  journal= {arXiv preprint arXiv:2403.05873},
  year   = {2024}
}

备注

Accepted to EASE'24