DocuMint:基于小型语言模型的 Python 文档字符串生成
软件工程
2024-05-17 v1 机器学习
摘要
有效沟通——特别是通过文档——是软件开发中贡献者协作的命脉。近期语言模型(LM)的进展催生了新的参与者:能够进行代码生成、优化和维护的 LM 驱动型助手。我们研究了小型语言模型(SLM)生成高质量文档字符串的效能,通过准确性、简洁性和清晰性进行评估,分别采用数学公式进行量化评估,并通过使用 Likert 量表进行人类评估。进一步,我们引入DocuMint作为大规模监督式微调数据集,包含10万样本。在量化实验中,Llama 3 8B在所有指标上取得最佳表现,简洁性和清晰性得分为0.605和64.88。然而在人类评估中,CodeGemma 7B在所有指标上平均得分为8.3分(满分10分)。使用DocuMint数据集对CodeGemma 2B模型进行微调后,在所有指标上均实现显著提升,简洁性提升最高可达22.5%。最终微调后的模型和数据集可在HuggingFace上获取,代码可在仓库中找到。
引用
@article{arxiv.2405.10243,
title = {DocuMint: Docstring Generation for Python using Small Language Models},
author = {Bibek Poudel and Adam Cook and Sekou Traore and Shelah Ameli},
journal= {arXiv preprint arXiv:2405.10243},
year = {2024}
}
备注
12 pages, 4 figures