面向多人情景下的解耦式灵活交互式人像抠图——DFIMat
最优化与控制
2026-02-03 v2
摘要
交互式人像抠图指通过用户输入从给定图像中提取最符合用户意图的柔软人像。现有方法在复杂情景下往往表现不佳,主要源于三个因素:(1)大多数工作采用紧密耦合的网络直接预测抠图结果,缺乏可解释性,导致建模不足;(2)现有工作仅限于单一类型的用户输入,对意图理解不有效,也不够高效;(3)多轮交互特征被严重低估,这对于用户交互至关重要。为缓解这些限制,我们提出 DFIMat,一个解耦框架,实现灵活的交互式抠图。具体而言,我们首先将任务解耦为两个子任务:通过理解场景语义和灵活的用户输入来定位目标实例,以及对实例级别的抠图进行精炼。我们观察到解耦带来了明显的性能提升,因为它使子任务更易学习,灵活的多类型输入进一步增强了效果与效率。DFIMat 还考虑了多轮交互特性,设计了对比推理模块以增强跨轮次的精炼。另一个多人抠图任务的限制是缺乏训练数据。我们通过引入新的合成数据生成管道来解决此问题,该管道能够生成比以往更真实的样本。随后建立了大型数据集 SMPMat。实验验证了 DFIMat 的显著优势。我们还探讨了不同输入类型的作用,为用户提供了宝贵的原则。我们的代码和数据集可在 https://github.com/JiaoSiyi/DFIMat 找到。
引用
@article{arxiv.2410.09786,
title = {An extension of Ordered Weighted Averaging over intervals with application to optimization under risk},
author = {Werner Baak and Marc Goerigk and Adam Kasperski and Paweł Zieliński},
journal= {arXiv preprint arXiv:2410.09786},
year = {2026}
}