SuperTML:用于结构化表格数据预认知的二维词嵌入方法
计算机视觉与模式识别
2019-06-05 v3
摘要
表格数据是工业界最常用的数据形式。梯度提升树、支持向量机、随机森林和逻辑回归通常用于表格数据的分类任务。使用类别嵌入的 DNN 模型也应用于此任务,但迄今为止所有尝试均采用一维嵌入。近期 Super Characters 方法利用二维词嵌入在文本分类任务中取得了最先进(state-of-the-art, SOTA)结果,展示了这一新方法的潜力。本文提出 SuperTML 方法,借鉴 Super Characters 方法与二维嵌入的思想,解决表格数据分类问题。对于每条表格数据输入,首先将特征投影为类似图像的二维嵌入,然后将该图像送入微调的二维 CNN 模型进行分类。实验结果表明,所提出的 SuperTML 方法在大型和小型数据集上均取得了最先进的结果。
引用
@article{arxiv.1903.06246,
title = {SuperTML: Two-Dimensional Word Embedding for the Precognition on Structured Tabular Data},
author = {Baohua Sun and Lin Yang and Wenhan Zhang and Michael Lin and Patrick Dong and Charles Young and Jason Dong},
journal= {arXiv preprint arXiv:1903.06246},
year = {2019}
}
备注
9 pages, 5 figures, 3 tables. Accepted by CVPR2019 Precognition Workshop