结构决定性:视频对象分割中的边界细化问题重审
计算机视觉与模式识别
2025-07-28 v1 图像与视频处理
摘要
给定对象掩码,半监督视频对象分割(SVOS)技术旨在跟踪和分割对象在视频帧之间的对象,作为计算机视觉中的一个基本任务。虽然最近的基于记忆的方法显示出潜力,但它们往往在涉及遮挡的场景时难以处理,尤其是在处理对象交互和高特征相似性方面。为解决这些问题并满足下游应用的实时处理需求,本文提出了一种新型方法,即利用内在结构细化的边界修订视频对象分割方法,命名为 OASIS。具体而言,提出了轻量级的结构细化模块以提高分割精度。通过融合由 Canny 过滤器捕获的粗糙边缘先验和存储的对象特征,该模块可生成对象级别的结构图并通过突出边界特征来细化表示。引入证据学习进行不确定性估计以进一步解决遮挡区域的挑战。所提出的方法 OASIS 保持高效设计,尽管在具有挑战性的基准测试上进行了大量实验,显示其在性能和推理速度方面优于其他最新方法,即在 DAVIS-17 验证集上实现 91.6 的 F 分数(相对于 89.7),在 YouTubeVOS 2019 验证集上实现 86.6 的 G 分数(相对于 86.2),同时保持 48 FPS 的竞争性速度。
引用
@article{arxiv.2507.18944,
title = {Structure Matters: Revisiting Boundary Refinement in Video Object Segmentation},
author = {Guanyi Qin and Ziyue Wang and Daiyun Shen and Haofeng Liu and Hantao Zhou and Junde Wu and Runze Hu and Yueming Jin},
journal= {arXiv preprint arXiv:2507.18944},
year = {2025}
}