无需光栅化的矢量图形识别
计算机视觉与模式识别
2021-12-28 v3 图像与视频处理
摘要
在本文中,我们考虑一种不同的图像数据格式:矢量图形。与广泛用于图像识别的光栅图形相比,由于文档中图元的解析表示,矢量图形可被放大或缩小到任意分辨率而不产生走样或信息损失。此外,矢量图形能够提供关于低层元素如何分组形成高层形状或结构的额外结构信息。这些矢量图形的优点在现有方法中尚未被充分利用。为探索该数据格式,我们着眼于基础的识别任务:目标定位与分类。我们提出一种高效的无需 CNN 的流水线,其不将图形渲染为像素(即光栅化),而是以矢量图形的文本文档作为输入,称为 YOLaT(You Only Look at Text)。YOLaT 构建多图以建模矢量图形中的结构与空间信息,并提出了一种双流图神经网络以从图中检测目标。我们的实验表明,通过直接在矢量图形上操作,YOLaT 在平均精度与效率两方面均优于基于光栅图形的目标检测基线。
引用
@article{arxiv.2111.03281,
title = {Recognizing Vector Graphics without Rasterization},
author = {Xinyang Jiang and Lu Liu and Caihua Shan and Yifei Shen and Xuanyi Dong and Dongsheng Li},
journal= {arXiv preprint arXiv:2111.03281},
year = {2021}
}
备注
Accepted by NeurIPS2021