学习通用形状字典用于实时实例分割
计算机视觉与模式识别
2020-12-03 v1
摘要
我们提出了一种用于实例分割的新型显式形状表示。根据如何建模物体形状,当前的实例分割系统可分为隐式与显式两类模型。隐式方法通过难以解释的网络参数表示物体掩码/轮廓,并通过逐像素分类生成,占据主导地位。然而,以简单且可解释的模型对形状进行参数化的显式方法则较少被探索。由于生成最终形状的操作轻量,显式方法相比隐式方法具有明显的速度优势,这对实际应用至关重要。本文提出的 USD-Seg 采用线性模型,即带字典的稀疏编码,来表征物体形状。首先,它从大量形状数据集中学习一个字典,使得任意形状都能通过该字典分解为线性组合,故得名“通用形状字典”。随后,它在普通目标检测器上添加一个简单的形状向量回归头,以极小开销赋予检测器分割能力。在定量评估中,我们同时使用平均精度(AP)与所提出的 AP 效率(AP)指标,后者旨在同时衡量框架的计算消耗以满足实际应用需求。我们在具有挑战性的 COCO 数据集上报告实验结果:以 YOLOv4 为基础检测器时,单个模型在单张 Titan Xp GPU 上以 65 fps 取得 35.8 AP 与 27.8 AP;以 FCOS 为基础检测器时,以 12 fps 取得 34.1 AP 与 28.6 AP。
引用
@article{arxiv.2012.01050,
title = {Learning Universal Shape Dictionary for Realtime Instance Segmentation},
author = {Tutian Tang and Wenqiang Xu and Ruolin Ye and Lixin Yang and Cewu Lu},
journal= {arXiv preprint arXiv:2012.01050},
year = {2020}
}