中文

端到端人物实例抠图

计算机视觉与模式识别 2024-03-05 v1 人工智能

摘要

人物实例抠图旨在为图像中的每个人物实例估计 alpha 抠图,这极具挑战性且迄今为止鲜有研究。尽管已有一些努力尝试使用实例分割为每个实例生成 trimap 并应用基于 trimap 的抠图方法,但由于分割不准确,生成的 alpha 抠图往往不准确。此外,由于多次执行抠图方法,这种方法的计算效率低下。为了解决这些问题,本文提出了一种新颖的端到端人物实例抠图(E2E-HIM)框架,以更高效的方式同时进行多实例抠图。具体而言,通用感知网络首先提取图像特征,并将实例上下文解码为潜在码。然后,统一引导网络利用空间注意力和语义嵌入生成统一语义引导,编码所有实例的位置和语义对应关系。最后,实例抠图网络解码图像特征和统一语义引导,以预测所有实例级的 alpha 抠图。此外,我们构建了一个大规模人物实例抠图数据集(HIM-100K),包含超过 100,000 张带有实例 alpha 抠图标签的人物图像。在 HIM-100K 上的实验表明,所提出的 E2E-HIM 在人物实例抠图方面优于现有方法,误差降低了 50%,速度提高了 5 倍(在 640X640 图像中处理 6 个实例)。在 PPM-100、RWP-636 和 P3M 数据集上的实验表明,E2E-HIM 在传统人物抠图上也取得了具有竞争力的性能。

关键词

引用

@article{arxiv.2403.01510,
  title  = {End-to-End Human Instance Matting},
  author = {Qinglin Liu and Shengping Zhang and Quanling Meng and Bineng Zhong and Peiqiang Liu and Hongxun Yao},
  journal= {arXiv preprint arXiv:2403.01510},
  year   = {2024}
}