中文

APIDocBooster: 利用大语言模型增强 API 文档的先抽取后摘要框架

软件工程 2024-01-11 v2

摘要

API 文档通常是编程时最值得信赖的资源。已有许多方法被提出,通过从 Stack Overflow 等外部资源中总结补充信息来增强 API 文档。现有的基于抽取的摘要方法擅长生成忠实于源内容且不受输入长度限制的摘要,但存在固有的可读性局限性。另一方面,我们对基于生成的摘要方法(即 GPT-4)的实证研究表明,GPT-4 能够生成连贯且简洁的摘要,但在信息量和忠实度方面存在局限。我们提出了 APIDocBooster,这是一个先抽取后摘要的框架,无缝融合了抽取式摘要(即不受长度限制地生成忠实摘要)和生成式摘要(即生成连贯且简洁的摘要)的优势。APIDocBooster 包含两个阶段:(1) 上下文感知句子章节分类(CSSC)和 (2) 更新摘要(UPSUM)。CSSC 将从多个来源收集的 API 相关信息分类到 API 文档的各个章节中。UPSUM 首先生成有别于原始 API 文档的抽取式摘要,然后通过上下文学习在抽取式摘要的引导下生成摘要。为了实现对 APIDocBooster 的自动评估,我们构建了首个用于 API 文档增强的数据集。我们的自动评估结果显示,APIDocBooster 的每个阶段都大幅优于其基线方法。我们的人工评估也证明了 APIDocBooster 优于 GPT-4,并表明它将信息量、相关性和忠实度分别提高了 13.89%、15.15% 和 30.56%。

关键词

引用

@article{arxiv.2312.10934,
  title  = {APIDocBooster: An Extract-Then-Abstract Framework Leveraging Large Language Models for Augmenting API Documentation},
  author = {Chengran Yang and Jiakun Liu and Bowen Xu and Christoph Treude and Yunbo Lyu and Junda He and Ming Li and David Lo},
  journal= {arXiv preprint arXiv:2312.10934},
  year   = {2024}
}