CompFeat:面向视频实例分割的综合特征聚合
计算机视觉与模式识别
2020-12-08 v1
摘要
视频实例分割是一项复杂任务,我们需要对给定视频中的每个对象进行检测、分割与跟踪。以往方法仅利用单帧特征进行对象的检测、分割与跟踪,在视频场景中受运动模糊与剧烈外观变化等若干特有挑战的影响而表现不佳。为消除仅用单帧特征带来的歧义,我们提出一种新颖的综合特征聚合方法(CompFeat),借助时间与空间上下文信息在帧级与对象级精炼特征。该聚合过程以新的注意力机制精心设计的,显著提升了所学特征的判别力。我们进一步通过融合特征相似度与空间相似度的连体(siamese)设计,改善了模型的跟踪能力。在YouTube-VIS数据集上的实验验证了所提CompFeat的有效性。我们的代码将发布于https://github.com/SHI-Labs/CompFeat-for-Video-Instance-Segmentation。
引用
@article{arxiv.2012.03400,
title = {CompFeat: Comprehensive Feature Aggregation for Video Instance Segmentation},
author = {Yang Fu and Linjie Yang and Ding Liu and Thomas S. Huang and Humphrey Shi},
journal= {arXiv preprint arXiv:2012.03400},
year = {2020}
}
备注
Accepted to AAAI 2021