预测 GitHub 与 Stack Overflow 主题模型的优良配置
计算与语言
2019-03-12 v3 神经与进化计算
摘要
软件仓库包含大量文本数据,从源代码注释和问题描述,到 Stack Overflow 上的问题、回答和评论。为了理解这些文本数据,主题建模常被用作从文本体中发掘隐藏语义结构的文本挖掘工具。 latent Dirichlet allocation (LDA) 是一种常用的主题模型,旨在通过文本分组来解释语料库的结构。LDA 需要多个参数才能良好工作,而关于如何设置这些参数仅有粗略且有时相互冲突的指南。在本文中,我们贡献了 (i) 一项关于参数的广泛研究,以针对 GitHub 和 Stack Overflow 文本语料库得到良好的局部最优解,(ii) 对与八种编程语言相关的文本语料库的事后刻画,以及 (iii) 通过逐语料库 LDA 配置对语料库特征重要性的分析。我们发现 (1) 主题建模参数配置的流行经验法则不适用于我们实验中使用的语料库,(2) 从 GitHub 和 Stack Overflow 采样的语料库具有不同特征,需要不同配置以实现良好模型拟合,以及 (3) 我们能可靠地预测未见语料库的优良配置。这些发现支持研究人员和实践者在分析软件仓库中所含文本数据时高效确定合适的主题建模配置。
引用
@article{arxiv.1804.04749,
title = {Predicting Good Configurations for GitHub and Stack Overflow Topic Models},
author = {Christoph Treude and Markus Wagner},
journal= {arXiv preprint arXiv:1804.04749},
year = {2019}
}
备注
to appear as full paper at MSR 2019, the 16th International Conference on Mining Software Repositories