S3M:孪生栈(追踪)相似度度量
软件工程
2021-03-22 v1 机器学习
摘要
自动崩溃报告系统已成为软件开发中的事实标准。这些系统监控目标软件,如果发生崩溃,它们将详细信息发送到后端应用程序。随后,这些报告被聚合并用于开发过程以 1) 理解它是新问题还是已有问题,2) 将这些缺陷分配给合适的开发人员,以及 3) 获得应用程序缺陷全景的概览。报告聚合及后续操作的效率严重依赖于报告相似度度量的质量。然而,这类报告的一个显著特征是用户没有提供文本输入(即缺陷描述):它仅包含栈追踪信息。在本文中,我们提出 S3M(“extreme”)——首个基于深度学习计算栈追踪相似度的方法。它基于一个使用 biLSTM 编码器和全连接分类器计算相似度的孪生架构。我们的实验证明了我们的方法在开源数据和 JetBrains 私有数据集上相对于最先进方法的优越性。此外,我们回顾了栈追踪截断对结果质量的影响。
引用
@article{arxiv.2103.10526,
title = {S3M: Siamese Stack (Trace) Similarity Measure},
author = {Aleksandr Khvorov and Roman Vasiliev and George Chernishev and Irving Muller Rodrigues and Dmitrij Koznov and Nikita Povarov},
journal= {arXiv preprint arXiv:2103.10526},
year = {2021}
}