基于流行度的数据集成
人工智能
2022-09-29 v1 数据库
数字图书馆
摘要
随着对大规模分析关注的增长,我们越来越面临集成多源数据的需求。问题在于这些数据无法按原样复用。最终结果是成本高昂,且由此得到的集成数据同样难以按原样复用。iTelos 是一种通用方法论,旨在将这一过程的影响降至最低。其直观思想是依据数据的流行度区别对待:某数据集被复用的次数越多,它们将越被复用,且在各次复用间被改动得越少,从而在降低整体数据预处理成本的同时,提升向后兼容性与未来的共享性。
引用
@article{arxiv.2209.14049,
title = {Popularity Driven Data Integration},
author = {Fausto Giunchiglia and Simone Bocca and Mattia Fumagalli and Mayukh Bagchi and Alessio Zamboni},
journal= {arXiv preprint arXiv:2209.14049},
year = {2022}
}
备注
KGSWC 2022. Fourth Ibero-American Knowledge Graph and Semantic Web Conference joint with Third Indo-American Knowledge Graph and Semantic Web Conference 21-23 November 2022, Universidad Camilo Jos\'e Cela, Madrid, Spain. arXiv admin note: substantial text overlap with arXiv:2105.09418