中文

MMMS:多模态多表面交互式分割

计算机视觉与模式识别 2025-09-17 v1 机器学习

摘要

在本文中,我们提出了一种基于用户点击交互式创建分割掩码的方法。我们特别关注同一图像中同时存在的多个表面的分割。由于这些表面可能严重纠缠且相邻,我们还提出了一种新颖的扩展评估指标,以应对该场景的挑战。此外,所提出的方法能够使用多模态输入来辅助分割任务。该方法的核心是一个网络架构,其输入包括一张 RGB 图像、若干非 RGB 模态、一个错误的掩码以及编码后的点击。基于此输入,网络预测一个改进的分割掩码。我们设计的架构遵循两个条件:(1)RGB 主干网络仅作为黑盒可用。(2)为了减少响应时间,我们希望模型在图像特征提取和多模态融合之后整合交互特定信息。我们将整个任务称为多模态多表面交互式分割(MMMS)。我们能够展示多模态融合策略的有效性。通过使用额外的模态,我们的系统在 DeLiVER 数据集上平均每个表面将 NoC@90 降低了多达 1.28 次点击,在 MFNet 上降低了多达 1.19 次点击。除此之外,我们能够证明,在经典的单掩码交互式分割场景中测试时,我们仅使用 RGB 的基线模型达到了具有竞争力,在某些情况下甚至更优越的性能。

关键词

引用

@article{arxiv.2509.12963,
  title  = {MMMS: Multi-Modal Multi-Surface Interactive Segmentation},
  author = {Robin Schön and Julian Lorenz and Katja Ludwig and Daniel Kienzle and Rainer Lienhart},
  journal= {arXiv preprint arXiv:2509.12963},
  year   = {2025}
}

备注

19 pages, 11 figures, 10 pages