中文

面向网络数据挖掘的跨表掩码预训练

机器学习 2024-02-02 v2

摘要

表格数据遍布万维网,在支撑在线信息的数字架构中发挥着基础性作用。鉴于 ChatGPT 和 SAM 等大规模预训练模型近期在各领域的广泛影响,探索将预训练技术应用于网络表格数据挖掘已成为一个极具前景的研究方向。事实上,近期已有一些围绕该主题的工作,其中大多数(即便不是全部)都局限于固定模式/单表的范畴。由于先前模型的数据集规模与参数体量,我们认为尚未达到普适表格数据的“BERT 时刻”。这方面的进展显著落后于自然语言处理等对应研究领域。本工作中,我们首先明确了表格数据预训练背后的关键挑战,尤其是克服跨表障碍。作为一项开创性尝试,本工作主要(i)贡献了一个高质量真实世界表格数据集,(ii)提出了一种新颖、通用且高效的跨表预训练框架,称为 CM2,其核心包含一个语义感知的表格神经网络,可在几乎无限制的情况下统一编码异构表格,以及(iii)引入了一种新颖的预训练目标——提示掩码表建模(prompt Masked Table Modeling, pMTM)——受自然语言处理启发但精心定制以用于表格上的可扩展预训练。我们的大量实验证明了 CM2 的 SOTA 性能,并验证了跨表预训练能够增强各类下游任务。

关键词

引用

@article{arxiv.2307.04308,
  title  = {Towards Cross-Table Masked Pretraining for Web Data Mining},
  author = {Chao Ye and Guoshan Lu and Haobo Wang and Liyao Li and Sai Wu and Gang Chen and Junbo Zhao},
  journal= {arXiv preprint arXiv:2307.04308},
  year   = {2024}
}

备注

Accepted to WWW 2024