中文

Table2Vec:面向可基准化与可解释企业数据科学的自动化通用表示学习以编码全方位数据 DNA

机器学习 2021-12-06 v1 人工智能

摘要

企业数据通常涉及多个异构数据源与外部数据,分别记录业务活动、交易、客户人口统计、状态、行为、与企业的交互和通信,以及其产品、服务、生产、营销、运营与管理的消费和反馈等。企业数据科学中的一个关键挑战,是实现对全方位企业 DNA 的有效整体企业数据理解以及数据驱动的发现和决策。我们引入了一种神经编码器 Table2Vec,用于从全方位企业 DNA 中对客户等实体进行自动化通用表示学习,并具备自动化数据特征分析与数据质量增强。习得的通用表示可作为具代表性的、可基准化的企业数据基因组,并可用于企业级与领域特定的学习任务。Table2Vec 集成了基于低质量企业数据的自动化通用表示学习与下游学习任务。我们展示了 Table2Vec 在复杂异构多关系大表上刻画企业中客户全方位数据 DNA 以构建通用客户向量表示的应用。每位客户习得的通用表示是全方位的、具代表性的且可基准化的,可支持企业数据科学中企业级与领域特定的学习目标和任务。Table2Vec 显著优于通常用于企业分析的现有浅层、提升与深度学习方法。我们进一步讨论了自动化通用企业表示与学习以及习得的企数据 DNA 在自动化、通用、整体企业与合乎伦理的机器学习和数据科学中的研究机遇、方向与应用。

关键词

引用

@article{arxiv.2112.01830,
  title  = {Table2Vec: Automated Universal Representation Learning to Encode All-round Data DNA for Benchmarkable and Explainable Enterprise Data Science},
  author = {Longbing Cao and Chengzhang Zhu},
  journal= {arXiv preprint arXiv:2112.01830},
  year   = {2021}
}

备注

24 pages, 16 figures, 1 table