MobileInst:面向移动端的视频实例分割
计算机视觉与模式识别
2023-12-19 v2
摘要
移动设备上的视频实例分割是一个重要但极具挑战性的边缘 AI 问题。它主要受制于(1)逐帧像素级实例感知带来的沉重计算与内存开销,以及(2)用于目标跟踪的复杂启发式方法。为解决这些问题,我们提出 MobileInst,一种轻量且移动端友好的视频实例分割框架。首先,MobileInst 采用移动视觉 transformer 提取多级语义特征,并提出高效的基于查询的双 transformer 实例解码器用于掩码核,以及语义增强的掩码解码器以生成每帧的实例分割。其次,MobileInst 利用简单而有效的核复用与核关联来跟踪视频实例分割中的目标。此外,我们提出时间查询传递以增强核的跟踪能力。我们在 COCO 和 YouTube-VIS 数据集上开展实验以证明 MobileInst 的优越性,并在骁龙 778G 移动平台单 CPU 核心上评估推理延迟,未使用其他加速方法。在 COCO 数据集上,MobileInst 在移动 CPU 上取得 31.2 mask AP 与 433 ms,相较先前 SOTA 降低 50% 延迟。对于视频实例分割,MobileInst 在 YouTube-VIS 2019 上取得 35.0 AP,在 YouTube-VIS 2021 上取得 30.1 AP。代码将公开以促进实际应用与未来研究。
引用
@article{arxiv.2303.17594,
title = {MobileInst: Video Instance Segmentation on the Mobile},
author = {Renhong Zhang and Tianheng Cheng and Shusheng Yang and Haoyi Jiang and Shuai Zhang and Jiancheng Lyu and Xin Li and Xiaowen Ying and Dashan Gao and Wenyu Liu and Xinggang Wang},
journal= {arXiv preprint arXiv:2303.17594},
year = {2023}
}
备注
Accepted by AAAI 2024 Main Track; Code will be released