HODOR: 从静态图像中学习用于视频目标重分割的高级目标描述符
计算机视觉与模式识别
2022-11-23 v2 人工智能
摘要
现有的视频目标分割(VOS)最先进方法通过学习帧与帧之间的低层像素到像素对应关系来跨视频传播目标掩码。这需要大量密集标注的视频数据,此类数据标注成本高昂,且由于视频内的帧高度相关而存在大量冗余。有鉴于此,我们提出了 HODOR:一种通过有效利用标注的静态图像来理解目标外观和场景上下文,从而解决 VOS 问题的新颖方法。我们将图像帧中的目标实例和场景信息编码为鲁棒的高级描述符,随后可利用这些描述符在不同帧中对这些目标进行重分割。因此,与未使用视频标注训练的现有方法相比,HODOR 在 DAVIS 和 YouTube-VOS 基准测试上取得了最先进的性能。无需任何架构修改,HODOR 还可以利用循环一致性从单个已标注视频帧周围的视频上下文中进行学习,而其他方法则依赖于密集且时间一致的标注。源代码可在 https://github.com/Ali2500/HODOR 获取。
引用
@article{arxiv.2112.09131,
title = {HODOR: High-level Object Descriptors for Object Re-segmentation in Video Learned from Static Images},
author = {Ali Athar and Jonathon Luiten and Alexander Hermans and Deva Ramanan and Bastian Leibe},
journal= {arXiv preprint arXiv:2112.09131},
year = {2022}
}