将文本表示为抽象图像使图像分类器也能同时分类文本
计算与语言
2020-02-07 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
我们引入一种将文本数据转换为抽象图像表示的新方法,该方法允许基于图像的处理技术(例如图像分类网络)应用于基于文本的比较问题。我们将该技术应用于美国专利中发明人姓名的实体消歧。该方法将每条两个发明人姓名记录之间的两两比较文本转换为二维RGB(堆叠)图像表示。随后我们训练一个图像分类神经网络来判别此类两两比较图像,并使用训练好的网络将每对记录标记为匹配(同一发明人)或非匹配(不同发明人),获得了高度准确的结果。我们的新文本到图像表示方法也可更广泛地用于其他NLP比较问题,例如学术出版物的消歧,或需要同时分类文本与图像数据集的问题。
引用
@article{arxiv.1908.07846,
title = {Representing text as abstract images enables image classifiers to also simultaneously classify text},
author = {Stephen M. Petrie and T'Mir D. Julius},
journal= {arXiv preprint arXiv:1908.07846},
year = {2020}
}
备注
Minor changes in order to submit paper to a different conference (e.g. made minor changes to writing in several places and added extra data to Table 3 in order to make it clearer)