能否解释得更清楚些?面向软件工程应用的可理解文本分析
软件工程
2018-05-01 v1
摘要
文本挖掘方法被用于广泛的软件工程(SE)任务。文本挖掘的最大挑战是高维数据,即一个文档语料库可包含 到 个唯一词。为应对此复杂性,已应用一些极为复杂的文本挖掘方法。那种复杂性必要吗?是否存在更简便的方式快速生成与更复杂方法性能相当且人类可读的模型?为回答这些问题,我们探索结合LDA(隐狄利克雷分配)与FFTs(快速节俭树)对来自六个不同项目的NASA软件缺陷报告进行分类。FFTs基于心理科学原理设计,返回极易被人类理解的小型模型。与常用的文本挖掘方法及近期最先进系统(基于搜索的SE方法,自动调优LDA控制参数)相比,这些FFT模型非常小(深度 且仅引用4个主题的二叉树),因此易于理解。它们生成更快,并产生相似或更好的严重度预测。故我们可得出结论:至少在此处探索的数据集上,复杂文本挖掘模型可被LDA+FFTs等更简单方法替代。至少,我们推荐在以下情况使用LDA+FFTs:(a)当人类需要阅读、理解和审计模型时;或(b)作为探索软件项目文本工件的SE研究者的初始基线方法。
引用
@article{arxiv.1804.10657,
title = {Can You Explain That, Better? Comprehensible Text Analytics for SE Applications},
author = {Amritanshu Agrawal and Huy Tu and Tim Menzies},
journal= {arXiv preprint arXiv:1804.10657},
year = {2018}
}
备注
10+2 pages, submitted to ASE 2018