TraceSim:一种计算堆栈跟踪相似度的方法
软件工程
2020-09-29 v1
摘要
许多现代软件产品具有自动崩溃报告子系统。然而,众所周知同一缺陷可产生略有不同的报告。为应对此问题,报告通常被分组,常由开发人员手动完成。但手动分诊对于拥有大量用户群的产品变得不可行,这正是诸多自动化此任务方法出现的原因。此外,由于需妥善处理的大量报告,提升分诊质量十分重要。因此,即便相对微小的改进也能在报告分桶的整体准确性中发挥显著作用。多数现有研究使用某种堆栈跟踪相似度度量,或基于信息检索技术,或基于字符串匹配方法。但须强调,分诊质量仍不充分。本文描述 TraceSim——一种结合 TF-IDF、Levenshtein 距离与机器学习构建相似度度量的新方法以解决该问题。我们的度量已在工业级报告分诊系统中实现。在人工标注数据集上的评估显示,相较基线方法结果显著更优。
引用
@article{arxiv.2009.12590,
title = {TraceSim: A Method for Calculating Stack Trace Similarity},
author = {Roman Vasiliev and Dmitrij Koznov and George Chernishev and Aleksandr Khvorov and Dmitry Luciv and Nikita Povarov},
journal= {arXiv preprint arXiv:2009.12590},
year = {2020}
}
备注
6 pages, 1 figure, 3 tables