中文

指代图像抠图

计算机视觉与模式识别 2023-03-23 v3 人工智能

摘要

与传统的图像抠图不同——传统方法要么需要用户定义的涂鸦/三元图来提取特定前景对象,要么不加区分地直接提取图像中的所有前景对象——本文引入了一项新任务,称为指代图像抠图(Referring Image Matting, RIM),其旨在提取与给定自然语言描述最匹配的特定对象的精细 alpha 抠图,从而为图像抠图提供更自然、更简单的指令。首先,我们设计了一个全面的图像合成与表达生成引擎,基于公开数据集自动生成高质量图像及多样化文本属性,由此构建了一个大规模具有挑战性的数据集 RefMatte。RefMatte 包含 230 个对象类别、47,500 张图像、118,749 个表达-区域实体和 474,996 条表达。此外,我们构建了一个包含 100 张高分辨率自然图像的真实世界测试集,并手动标注复杂短语,以评估 RIM 方法的域外泛化能力。进一步地,我们提出了一种用于 RIM 的新基线方法 CLIPMat,包括上下文嵌入提示、文本驱动的语义弹出和多级细节提取器。在 RefMatte 上针对关键词和表达两种设定的大量实验验证了 CLIPMat 相对于代表性方法的优越性。我们希望本工作能为图像抠图提供新的见解,并鼓励更多后续研究。数据集、代码和模型可在 https://github.com/JizhiziLi/RIM 获取。

关键词

引用

@article{arxiv.2206.05149,
  title  = {Referring Image Matting},
  author = {Jizhizi Li and Jing Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2206.05149},
  year   = {2023}
}

备注

Accepted to CVPR2023. The dataset, code and models are available at https://github.com/JizhiziLi/RIM