MirrorSAM2:基于深度感知的视频镜像分割
计算机视觉与模式识别
2025-09-23 v1
摘要
本文提出了 MirrorSAM2,这是第一个将 Segment Anything Model 2 (SAM2) 适用于 RGB-D 视频镜像分割任务的框架。MirrorSAM2 通过引入四个定制化模块来解决镜像检测中的关键挑战问题,如反射歧义和纹理混淆:用于 RGB 与深度图对齐的深度变形模块、用于自动生成提示的深度引导的多尺度点提示生成器、用于增强结构边界的频率细节注意力融合模块,以及带有可学习镜像标记用于精细分割的镜像掩码解码器。通过充分利用 RGB 与深度之间的互补性,MirrorSAM2 将 SAM2 的能力扩展到无提示设置。迄今为止,这是第一个使 SAM2 能够进行自动视频镜像分割的工作。在 VMD 和 DVMD 数据集上的实验表明,MirrorSAM2 在面临小尺寸镜像、弱边界和强反射等具有挑战性条件时,仍能实现 SOTA(State-of-the-Art)性能。
引用
@article{arxiv.2509.17220,
title = {MirrorSAM2: Segment Mirror in Videos with Depth Perception},
author = {Mingchen Xu and Yukun Lai and Ze Ji and Jing Wu},
journal= {arXiv preprint arXiv:2509.17220},
year = {2025}
}
备注
8 pages