中文

在视频目标分割中学习标注的“什么”与“如何”

计算机视觉与模式识别 2023-11-14 v2

摘要

视频目标分割(VOS)对于从视频编辑到视频数据生成等多种应用至关重要。训练VOS模型需要大量人工标注的训练视频。事实上的传统标注方式要求人工在每一视频帧上为目标物体绘制精细的分割掩码。然而,这一标注过程繁琐且耗时。为降低标注成本,本文提出EVA-VOS,一种用于视频目标分割的人机协同标注框架。与传统方法不同,我们引入一个智能体,迭代预测应标注哪一帧(“什么”)以及使用何种标注类型(“如何”)。随后,标注者仅对选定帧进行标注,该帧用于更新VOS模块,从而显著节省标注时间。我们在MOSE和DAVIS数据集上开展实验,结果表明:(a) EVA-VOS生成的掩码精度接近人工一致性,且比标准视频标注方式快3.5倍;(b)我们的帧选择达到了最先进的性能;(c)相较于所有其他方法与时序基线,EVA-VOS在标注时间上取得了显著的性能提升。

关键词

引用

@article{arxiv.2311.04414,
  title  = {Learning the What and How of Annotation in Video Object Segmentation},
  author = {Thanos Delatolas and Vicky Kalogeiton and Dim P. Papadopoulos},
  journal= {arXiv preprint arXiv:2311.04414},
  year   = {2023}
}

备注

Accepted to WACV 2024