面向图像与视频的精细交互式分割
计算机视觉与模式识别
2025-02-17 v1 图像与视频处理
摘要
近期出现的 Segment Anything Models(SAM)已成为通用交互式分割的基础视觉模型。尽管展现出强大的泛化能力,但在需要精确掩码的场景下仍表现下降。现有高精度交互式分割方法在感知细粒度局部细节与保持稳定提示能力之间存在权衡,这阻碍了基础分割模型的适用性和有效性。为此,我们提出基于 SAM2 背bone 的 SAM2Refiner 框架。该架构使 SAM2 能够为图像和视频生成细粒度分割掩码,同时保留其固有优势。具体而言,我们设计了定位增强模块,通过跨注意力机制将局部语境线索融入全局特征,从而挖掘潜在的细节模式并保持语义信息。此外,为强化针对增强后对象嵌入的提示能力,我们引入提示重定向模块,以空间对齐的提示特征更新嵌入。最后,为获得准确的高分辨率分割掩码,我们构建多尺度级联结构的掩码细化模块,将掩码特征与编码器的层次表示融合。大量实验表明,我们的方法有效果,能够为图像和视频生成高度精确的掩码,超越当前最先进的方法。
引用
@article{arxiv.2502.09660,
title = {Towards Fine-grained Interactive Segmentation in Images and Videos},
author = {Yuan Yao and Qiushi Yang and Miaomiao Cui and Liefeng Bo},
journal= {arXiv preprint arXiv:2502.09660},
year = {2025}
}