中文

DFIMat:多人场景中解耦式灵活交互式抠图

计算机视觉与模式识别 2024-10-15 v1

摘要

交互式人物抠图指从给定图像中提取最符合用户意图的柔软人物轮廓。现有方法在复杂场景下表现不佳,主要源于三个因素。(1)大多数工作应用紧密耦合的网络,直接预测抠图结果,缺乏可解释性,导致建模不足。(2)现有工作仅限于单一类型的用户输入,这对意图理解不有效,也不高效。(3)多轮交互特征被低估,而这对于用户交互至关重要。为缓解这些限制,我们提出DFIMat,一个解耦框架,实现灵活的交互式抠图。具体而言,我们首先将任务解耦为两个子任务:通过理解场景语义和灵活的用户输入来定位目标实例,以及对实例级别的抠图进行精细化。我们观察到解耦带来的显著性能提升,因为它使子任务更易学习,灵活的多类型输入进一步增强了有效性和效率。DFIMat还考虑了多人抠图任务的局限性,即缺乏训练数据。我们通过引入新的合成数据生成管道来解决这一问题,该管道能够生成比以往艺术品更真实的样本。随后建立了一个大型数据集SMPMat。实验验证了DFIMat的显著优势。我们还探讨了不同输入类型的作用,为用户提供了有价值的原则。我们的代码和数据集可在 https://github.com/JiaoSiyi/DFIMat 获取。

关键词

引用

@article{arxiv.2410.09788,
  title  = {DFIMat: Decoupled Flexible Interactive Matting in Multi-Person Scenarios},
  author = {Siyi Jiao and Wenzheng Zeng and Changxin Gao and Nong Sang},
  journal= {arXiv preprint arXiv:2410.09788},
  year   = {2024}
}

备注

Accepted by ACCV 2024