SpreadCluster:通过基于相似性的聚类恢复带版本电子表格
软件工程
2017-04-28 v1
摘要
版本信息在电子表格的理解、维护和质量改进中起着重要作用。然而,最终用户很少使用版本控制工具来记录电子表格版本信息。因此,电子表格版本信息缺失,且同一电子表格的不同版本作为独立且相似的电子表格共存。现有方法试图通过基于电子表格文件名或相关电子邮件会话对这些相似电子表格进行聚类来恢复版本信息。然而,由于必要信息(例如文件名和电子邮件会话)通常缺失,现有聚类方法的适用性和准确性受限。我们检查了从Enron公司提取的VEnron中的带版本电子表格。在VEnron中,同一电子表格的不同版本被聚为一个演化组。我们观察到每个演化组中的带版本电子表格表现出某些共同特征(例如相似的表头和工作表名)。基于该观察,我们提出了一种自动聚类算法SpreadCluster。SpreadCluster从VEnron中的带版本电子表格学习特征准则,然后自动将具有相似特征的电子表格聚到同一演化组。我们将SpreadCluster应用于Enron语料库中的所有电子表格。评估结果表明,与VEnron使用的基于文件名的方法相比,SpreadCluster能以更高的准确率和召回率对电子表格进行聚类。基于SpreadCluster的聚类结果,我们进一步创建了一个新的带版本电子表格语料库VEnron2,其规模远大于VEnron。我们还将SpreadCluster应用于另外两个电子表格语料库FUSE和EUSES。结果表明,SpreadCluster能以高精度对这两个语料库中的带版本电子表格进行聚类。
引用
@article{arxiv.1704.08476,
title = {SpreadCluster: Recovering Versioned Spreadsheets through Similarity-Based Clustering},
author = {Liang Xu and Wensheng Dou and Chushu Gao and Jie Wang and Jun Wei and Hua Zhong and Tao Huang},
journal= {arXiv preprint arXiv:1704.08476},
year = {2017}
}
备注
12 pages, MSR 2017