TransMatting:配备三标记符的 Transformer 图像抠图模型
计算机视觉与模式识别
2023-03-14 v1
摘要
图像抠图旨在预测自然图像中精细不确定区域(如头发、烟雾和蜘蛛网)的 alpha 值。然而,现有方法在面临高度透明前景物体时表现不佳,原因在于待预测的不确定区域面积大且卷积网络感受野小。为解决此问题,我们提出一种基于 Transformer 的网络(TransMatting)以利用长程特征建模透明物体,并收集了一个透明物体高分辨率抠图数据集(Transparent-460)用于性能评估。具体而言,为灵活有效地利用 trimap 中的语义信息,我们还将 trimap 重新设计为三个可学习标记符,称为 tri-token(三标记符)。Transformer 和卷积抠图模型均可从我们提出的 tri-token 设计中受益。通过用我们的 tri-token 替换传统 trimap 拼接策略,现有抠图方法在 SAD 上可实现约 10% 提升、在 MSE 上约 20% 提升。配备新 tri-token 设计,我们提出的 TransMatting 在多个流行抠图基准及我们新收集的 Transparent-460 上均优于当前最优方法。
关键词
引用
@article{arxiv.2303.06476,
title = {TransMatting: Tri-token Equipped Transformer Model for Image Matting},
author = {Huanqia Cai and Fanglei Xue and Lele Xu and Lili Guo},
journal= {arXiv preprint arXiv:2303.06476},
year = {2023}
}