基于字符级卷积神经网络的表格数据集语义分类
计算与语言
2019-01-25 v1 机器学习
摘要
受“自动化机器学习”(AutoML)应用启发,我们提出一种字符级卷积神经网络(CNN)用于对表格数据中的列进行语义分类。首先使用包含一组基类的模拟数据学习初始权重集合。随后采用 CKAN 仓库中人工标注的数据,以迁移学习范式将初始权重适配为对问题更精细的表示(例如包含更多类别)。在此过程中,系统学习了真实数据的不完美性,且可在减少标注数据与计算资源需求的情况下,从基类别集合扩展所处理的类别集合。结果表明该方法在三个不同领域有效且灵活:表格数据语义分类、社交媒体帖子年龄预测以及电子邮件垃圾分类。除进一步证明迁移学习在自然语言处理(NLP)中的有效性外,我们的实验表明,在字符级分析语言语义结构且无需额外元数据(如网络结构、信头等)的情况下,可在类型分类、垃圾分类和社交媒体年龄预测中取得有竞争力的准确率。我们发布了开源工具包 SIMON(Semantic Inference for the Modeling of ONtologies,本体建模的语义推断)以用户友好且可扩展/并行化的方式实现该方法。
引用
@article{arxiv.1901.08456,
title = {Semantic Classification of Tabular Datasets via Character-Level Convolutional Neural Networks},
author = {Paul Azunre and Craig Corcoran and Numa Dhamani and Jeffrey Gleason and Garrett Honke and David Sullivan and Rebecca Ruppel and Sandeep Verma and Jonathon Morgan},
journal= {arXiv preprint arXiv:1901.08456},
year = {2019}
}