KGLiDS:面向数据科学语义抽象、关联与自动化的平台
机器学习
2024-06-13 v4
摘要
近年来,我们见证了学术界和工业界对应用数据科学技术分析大量数据日益增长的兴趣。在此过程中,产生了无数工件(数据集、流水线脚本等)。然而,尚未有系统性尝试去整体收集并利用这些工件中隐式包含的所有知识与经验。相反,数据科学家从同事处恢复信息和专长,或通过试错学习。因此,本文提出一个可扩展平台 KGLiDS,它采用机器学习和知识图谱技术来抽象并捕获数据科学工件及其关联的语义。基于这些信息,KGLiDS 支持多种下游应用,如数据发现和流水线自动化。我们的综合评估涵盖了数据发现、数据清洗、转换和 AutoML 中的用例。结果表明,KGLiDS 比最先进系统显著更快且内存占用更低,同时达到可比或更好的精度。
引用
@article{arxiv.2303.02204,
title = {KGLiDS: A Platform for Semantic Abstraction, Linking, and Automation of Data Science},
author = {Mossad Helali and Niki Monjazeb and Shubham Vashisth and Philippe Carrier and Ahmed Helal and Antonio Cavalcante and Khaled Ammar and Katja Hose and Essam Mansour},
journal= {arXiv preprint arXiv:2303.02204},
year = {2024}
}
备注
15 pages, 9 figures