基于鲁棒上下文融合的在线视频实例分割
计算机视觉与模式识别
2022-07-13 v1
摘要
视频实例分割(VIS)旨在对视频序列中的对象实例进行分类、分割与跟踪。近期基于transformer的神经网络已展现出为VIS任务建模时空相关性的强大能力。依赖于视频或片段级输入,它们面临高延迟与高计算成本。我们提出一种鲁棒上下文融合网络以在线方式处理VIS,其利用少量前序帧逐帧预测实例分割。为高效获取每帧精确且时间一致的预测,关键思想是将参考帧中有效且紧凑的上下文融合至目标帧。考虑到参考帧与目标帧对目标预测的不同影响,我们首先通过重要性感知压缩来汇总上下文特征。采用transformer编码器融合压缩后的上下文。随后,我们利用保序实例嵌入传递身份感知信息并将身份对应于预测的实例掩码。我们证明,我们的鲁棒融合网络在现有在线VIS方法中取得最佳性能,且优于先前发表的片段级方法(在Youtube-VIS 2019与2021基准上)。此外,视觉对象常具有声学特征,在含音频的视频记录中与之自然同步。借助我们的上下文融合网络对多模态数据的灵活性,我们进一步探究了音频对视频密集预测任务的影响,这是现有工作从未讨论过的。我们构建了音频-视觉实例分割数据集,并证明野外场景中的声学信号可有益于VIS任务。
引用
@article{arxiv.2207.05580,
title = {Online Video Instance Segmentation via Robust Context Fusion},
author = {Xiang Li and Jinglu Wang and Xiaohao Xu and Bhiksha Raj and Yan Lu},
journal= {arXiv preprint arXiv:2207.05580},
year = {2022}
}