MAIN:用于视频分割的多注意力实例网络
计算机视觉与模式识别
2019-04-12 v1
摘要
实例级视频分割需要空间与时间信息的扎实整合。然而,当前方法主要依赖特定领域的信息(在线学习)来产生准确的实例级分割。我们提出了一种完全依赖通用时空注意力线索整合的新方法。我们的策略名为多注意力实例网络(MAIN),无需建模特定于序列或实例的知识,即可克服任意视频中的挑战性分割场景。我们将MAIN设计为在单次前向传递中分割多个实例,并使用一种新的损失函数对其进行优化,该函数支持类别无关预测并分配实例特定的惩罚。我们在具有挑战性的Youtube-VOS数据集和基准上取得了SOTA性能,将未见类别的Jaccard和F-Metric分别提升了6.8%和12.7%,同时以实时速度(30.3 FPS)运行。
引用
@article{arxiv.1904.05847,
title = {MAIN: Multi-Attention Instance Network for Video Segmentation},
author = {Juan Leon Alcazar and Maria A. Bravo and Ali K. Thabet and Guillaume Jeanneret and Thomas Brox and Pablo Arbelaez and Bernard Ghanem},
journal= {arXiv preprint arXiv:1904.05847},
year = {2019}
}