见更多,知更多:基于协同注意力孪生网络的无监督视频对象分割
计算机视觉与模式识别
2020-01-22 v1
摘要
我们提出一种称为协同注意力孪生网络(COSNet)的新模型,从整体视角解决无监督视频对象分割任务。我们强调视频帧间内在关联的重要性,并引入全局协同注意力机制,以进一步改进主要聚焦于在短期时间片段上基于外观与运动学习判别性前景表示的当前最优深度学习解法。我们网络中的协同注意力层通过联合计算并将协同注意力响应追加至联合特征空间,提供了捕获全局关联与场景上下文的高效且有力的阶段。我们用视频帧对训练 COSNet,这自然扩充了训练数据并提升了学习能力。在分割阶段,协同注意力模型通过共同处理多个参考帧编码有用信息,借此更好地推断频繁重现且显著的前景对象。我们提出一个统一且端到端可训练的框架,可导出不同协同注意力变体以挖掘视频内丰富上下文。我们在三个大型基准上的大量实验表明,COSNet 大幅优于现有替代方法。
引用
@article{arxiv.2001.06810,
title = {See More, Know More: Unsupervised Video Object Segmentation with Co-Attention Siamese Networks},
author = {Xiankai Lu and Wenguan Wang and Chao Ma and Jianbing Shen and Ling Shao and Fatih Porikli},
journal= {arXiv preprint arXiv:2001.06810},
year = {2020}
}
备注
CVPR2019. Weblink: https://github.com/carrierlxk/COSNet