SketchParse:利用多任务分层深度网络为潦草草图生成丰富描述
计算机视觉与模式识别
2017-09-06 v1 图形学
多媒体
摘要
语义解释手绘线条草图的能力虽极具挑战,却能为多媒体带来新颖应用。我们提出 SketchParse,首个用于自由手绘物体草图全自动解析的深度网络架构。SketchParse 配置为两级全卷积网络。第一级包含对所有物体类别共享的层。第二级包含多个专家子网络,每个专家专用于解析具有结构相似部件的类别中的草图。两级配置使我们的架构在新增类别时能高效扩展。我们引入路由层,其 (i) 将草图特征从共享层中继至正确的专家,(ii) 免除在推理时手动指定物体类别的需要。为避开费力的部件级标注,我们将语义物体-部件图像数据集中的照片草图化并用于训练。我们的架构还将物体姿态预测作为新颖的辅助任务,在提升整体性能的同时提供关于草图的补充信息。我们展示了 SketchParse 的能力:(i) 在两个具挑战性的大规模草图数据集上,(ii) 解析未见过的、语义相关的物体类别,(iii) 改进细粒度基于草图的图像检索。作为一种新颖应用,我们还概述了如何利用 SketchParse 的输出为手绘草图生成标题式描述。
引用
@article{arxiv.1709.01295,
title = {SketchParse : Towards Rich Descriptions for Poorly Drawn Sketches using Multi-Task Hierarchical Deep Networks},
author = {Ravi Kiran Sarvadevabhatla and Isht Dwivedi and Abhijat Biswas and Sahil Manocha and R. Venkatesh Babu},
journal= {arXiv preprint arXiv:1709.01295},
year = {2017}
}
备注
A shorter version of this submission was accepted at ACM Multimedia (ACMMM) 2017. Code, annotated datasets and pre-trained models available at https://github.com/val-iisc/sketch-parse