中文

度量沼泽度:大型异构数据存储库中的混乱量化

信息检索 2018-10-16 v1

摘要

随着科学数据存储库与文件系统规模和复杂度的增长,它们变得日益无组织。海量数据与非良好组织的耦合使得科学家难以定位和利用相关数据,从而减缓了分析感兴趣数据的过程。为解决这些问题,我们探索一种用于量化数据存储库组织程度的自动聚类方法。我们的并行流水线处理异构文件类型(如文本与表格数据),基于内容与元数据相似性自动聚类文件,并从所得聚类中计算一种新颖的“清洁度”分数。我们使用合成与真实数据集展示了我们清洁度度量的生成与准确性,并得出结论:它比其他潜在的清洁度度量更为一致。

关键词

引用

@article{arxiv.1810.05784,
  title  = {Measuring Swampiness: Quantifying Chaos in Large Heterogeneous Data Repositories},
  author = {Luann Jung and Brendan Whitaker and Kyle Chard and Aaron Elmore},
  journal= {arXiv preprint arXiv:1810.05784},
  year   = {2018}
}

备注

In Proceedings of ACM Student Poster Competition (SC'18)