RPT:关系预训练 Transformer 近乎是实现数据准备平民化所需的一切
机器学习
2021-04-01 v2 数据库
摘要
AI 能否帮助自动化那些对人简单但对计算机困难、且困扰数据科学家、从业者和众包工人的数据准备任务?我们通过提出 RPT 来回答这一问题,RPT 是一种用于元组到 X 模型(X 可以是元组、词元、标签、JSON 等)的去噪自编码器。RPT 通过破坏输入元组然后学习重建原始元组的模型,被预训练为元组到元组模型。它采用基于 Transformer 的神经翻译架构,由双向编码器(类似 BERT)和自左向右自回归解码器(类似 GPT)组成,从而推广了 BERT 与 GPT。预训练好的 RPT 已可支持若干常见数据准备任务,如数据清洗、自动补全和模式匹配。更好的是,RPT 可在广泛的数据准备任务上微调,如值规范化、数据转换、数据标注等。为补充 RPT,我们还讨论了若干引人关注的技术,如用于实体解析的协同训练与少样本学习,以及用于信息抽取的少样本学习与 NLP 问答。此外,我们确定了一系列推动数据准备领域发展的研究机遇。
引用
@article{arxiv.2012.02469,
title = {RPT: Relational Pre-trained Transformer Is Almost All You Need towards Democratizing Data Preparation},
author = {Nan Tang and Ju Fan and Fangyi Li and Jianhong Tu and Xiaoyong Du and Guoliang Li and Sam Madden and Mourad Ouzzani},
journal= {arXiv preprint arXiv:2012.02469},
year = {2021}
}