面向人机交互的虚拟多模态自监督前景抠图
计算机视觉与模式识别
2021-10-25 v2 人工智能
摘要
大多数现有人体抠图算法试图将纯人体现前景与背景分离。本文提出一种虚拟多模态前景抠图(VMFM)方法,从原始RGB图像中学习人机交互前景(人及其交互的物体)。VMFM方法无需额外输入,如trimap或已知背景。我们将前景抠图重新表述为自监督多模态问题:使用三个自编码器将每幅输入图像分解为估计深度图、分割掩码与交互热力图。为充分利用各模态特性,我们首先训练双编码器-解码器网络以估计相同的alpha抠图。随后引入一种自监督方法:互补学习(CL),在无标签情况下预测偏差概率图并跨模态交换可靠梯度。我们进行了大量实验以分析各模态的有效性及互补学习中不同组件的重要性。我们证明模型优于最先进方法。
引用
@article{arxiv.2110.03278,
title = {Virtual Multi-Modality Self-Supervised Foreground Matting for Human-Object Interaction},
author = {Bo Xu and Han Huang and Cheng Lu and Ziwen Li and Yandong Guo},
journal= {arXiv preprint arXiv:2110.03278},
year = {2021}
}
备注
Accepted by ICCV2021