从 README 中提取功能:阅读隐含信息
计算与语言
2024-03-18 v1 人工智能
摘要
虽然文本摘要是已知的自然语言处理任务,但本文提出了一种新型且实用的变体,即从 Git README 文件中提取功能。尽管该任务在抽象层面上是文本到文本生成,但其独特的特性和挑战使得现有的文本到文本生成系统并不实用。该任务的动机源于近期围绕大型语言模型用于代码相关任务(如代码重构、代码摘要等)的研究和开发活动的激增。我们发布了一个人工标注的数据集称为 FuncRead,并构建了一套模型用于该任务。我们的全面实验表明,小规模微调模型在性能上优于任何基于流行的黑箱或白箱大型语言模型(如 ChatGPT 和 Bard)所能设计的基线模型。我们最佳的70亿参数CodeLlama模型在 F1 分数上相较于 ChatGPT 和 Bard 分别提升了 70% 和 20%。
引用
@article{arxiv.2403.10205,
title = {Read between the lines -- Functionality Extraction From READMEs},
author = {Prince Kumar and Srikanth Tamilselvam and Dinesh Garg},
journal= {arXiv preprint arXiv:2403.10205},
year = {2024}
}