开源软件问题讨论的信息类型分析与检测
软件工程
2019-02-20 v1
摘要
大多数现代开源软件(OSS)项目的 Issue 跟踪系统(ITSs)允许用户对问题添加评论。随着时间推移,这些评论累积成讨论线程,其中嵌入了关于软件项目的丰富信息,有可能满足 OSS 利益相关者的多样化需求。然而,从讨论线程中发现和检索相关信息是一项具有挑战性的任务,尤其在讨论冗长且 ITSs 中问题数量庞大时。本文通过识别 OSS 问题讨论中呈现的信息类型来应对该挑战。通过对 GitHub 上三个项目的 15 个复杂问题线程进行定性内容分析,我们揭示了 16 种信息类型,并创建了一个包含 4656 个句子的标注语料库。我们对有监督自动分类技术的调研表明,当关于问题的先验知识可用时,随机森林(Random Forest)可利用句子长度与位置等会话特征有效检测大多数句子类型。在对新问题中的句子分类时,逻辑回归(Logistic Regression)可利用文本特征对某些信息类型产生令人满意的性能,而在其他类型上表现不足。我们的工作朝着为识别和获取 ITSs 中记录的丰富信息以支持各类软件工程活动并满足 OSS 利益相关者多样需求工具与技术,迈出了重要第一步。
引用
@article{arxiv.1902.07093,
title = {Analysis and Detection of Information Types of Open Source Software Issue Discussions},
author = {Deeksha Arya and Wenting Wang and Jin L. C. Guo and Jinghui Cheng},
journal= {arXiv preprint arXiv:1902.07093},
year = {2019}
}
备注
41st ACM/IEEE International Conference on Software Engineering (ICSE2019)