Doc2Im:基于自注意力嵌入的文档到图像转换
计算与语言
2018-11-09 v1 计算机视觉与模式识别
摘要
文本分类是NLP应用中的一项基础任务。该领域的最新研究大致分为两个主要子方向。其一为学习表示,其二是学习更深的模型(包括序列与卷积模型),而这又回归到表示问题。我们提出一种观点:表示越强,所需分类器模型越简单即可获得更高性能。本文提出一个全新的文本分类研究方向,将文本转换为与图像极为相似的表示,使得任何能处理图像的深度网络同样能处理文本。我们深入考察将文档表示为图像的方法,随后直接采用计算机视觉领域中基于卷积的极简模型。该图像可像其他图像一样被裁剪、重缩放、重采样与增强,从而适配大多数为大规模图像数据集设计的最先进大型卷积模型。我们在相关领域若干最新基准上展示了令人印象深刻的成果。我们进行了迁移学习实验,包括从文本到文本域以及从图像到文本域。我们认为这相对于传统的文档理解与文本分类方式是一种范式转变,并将推动社区中众多新颖的研究思路。
引用
@article{arxiv.1811.03291,
title = {Doc2Im: document to image conversion through self-attentive embedding},
author = {Mithun Das Gupta},
journal= {arXiv preprint arXiv:1811.03291},
year = {2018}
}