用于视频实例级人体解析的自适应时间编码网络
计算机视觉与模式识别
2018-08-13 v2
摘要
除静态图像中已有单人及多人人体解析任务外,本文首次尝试研究一种更贴近现实的视频实例级人体解析,其同时分割出每个人体实例并将每个实例解析为更细粒度的部位(如头、腿、连衣裙)。我们提出一种新颖的自适应时间编码网络(ATEN),其在关键帧之间交替执行关键帧间的时间编码以及由光流引导的其余连续帧特征传播。具体而言,ATEN 首先集成 Parsing-RCNN 为每个关键帧生成实例级解析结果,该结果将全局人体解析与实例级人体分割统一于一个模型中。为平衡精度与效率,光流引导的特征传播用于依据连续帧与关键帧间已识别的时间一致性直接解析连续帧。另一方面,ATEN 利用卷积门控循环单元(convGRU)挖掘一系列关键帧上的时间变化,并进一步用于辅助帧级实例级解析。通过交替执行一致帧间的直接特征传播与关键帧间的时间编码网络,我们的 ATEN 在帧级精度与时间效率间取得良好平衡,这也是视频目标分割研究中常见的关键问题。为证明 ATEN 的优越性,我们在最流行的视频分割基准(DAVIS)与新收集的 Video Instance-level Parsing(VIP)数据集上进行了充分实验,VIP 是首个视频实例级人体解析数据集,包含 404 个序列及超过 20k 带实例级与像素级标注的帧。
引用
@article{arxiv.1808.00661,
title = {Adaptive Temporal Encoding Network for Video Instance-level Human Parsing},
author = {Qixian Zhou and Xiaodan Liang and Ke Gong and Liang Lin},
journal= {arXiv preprint arXiv:1808.00661},
year = {2018}
}
备注
To appear in ACM MM 2018. Code link: https://github.com/HCPLab-SYSU/ATEN. Dataset link: http://sysu-hcp.net/lip