在线不确定性基于的用户交互实现长期视频对象分割的平衡
计算机视觉与模式识别
2024-11-14 v2 人机交互
机器学习
摘要
本文提出了一种称为懒惰视频对象分割 (ziVOS) 的视频对象分割 (VOS) 变体,旨在构建交互式和半自动方法之间的桥梁。与两种以离线方式(即预录制序列)处理视频对象分割的任务相反,我们提出通过 ziVOS 面向在线录制的序列。为此,我们努力在长期场景下通过在分割过程中 soliciting 用户反馈来实现性能和鲁棒性之间的平衡。因此,我们旨在最大化感兴趣对象的跟踪持续时间,同时要求最小的用户更正以维持长时间的跟踪。我们提出了一个竞争性基线,即 Lazy-XMem,作为 ziVOS 的参考。我们的方法使用跟踪状态的不确定性估计来确定是否需要用户交互来细化模型的预测。为量化评估我们方法和用户工作量的性能,我们引入了除该领域已 established 指标之外的补充指标。我们使用最近引入的 LVOS 数据集进行评估,该数据集提供了众多长期视频。我们的代码已公开于 https://github.com/Vujas-Eteph/LazyXMem。
引用
@article{arxiv.2408.00169,
title = {Strike the Balance: On-the-Fly Uncertainty based User Interactions for Long-Term Video Object Segmentation},
author = {Stéphane Vujasinović and Stefan Becker and Sebastian Bullinger and Norbert Scherer-Negenborn and Michael Arens and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2408.00169},
year = {2024}
}
备注
Accepted at ACCV 2024