利用三维形状、姿态与外观一致性的循环自监督学习实现逼真人体重摆姿
计算机视觉与模式识别
2021-10-12 v1
摘要
从单张图像合成人物在新姿态下的图像是一项高度模糊的任务。大多数现有方法需要配对的训练图像,即同一人穿着相同衣物处于不同姿态的图像。然而,获取足够大规模的配对数据集具有挑战性且成本高昂。先前放弃配对监督的方法缺乏真实感。我们提出了一种名为 SPICE(Self-supervised Person Image CrEation,自监督人物图像生成)的自监督框架,缩小了与有监督方法在图像质量上的差距。实现自监督的关键洞见是以多种方式利用关于人体三维信息的线索。首先,重摆姿时三维身体形状必须保持不变。其次,用三维表示身体姿态能够推理自遮挡问题。第三,重摆姿前后可见的三维身体部位应具有相似的外观特征。一旦训练完成,SPICE 接收一张人物图像并生成该人物在新目标姿态下的新图像。SPICE 在 DeepFashion 数据集上取得了最先进的性能,与先前无监督方法相比将 FID 分数从 29.9 提升至 7.8,并且性能接近于最先进的有监督方法(6.4)。尽管仅在静态图像上训练,SPICE 还能给定输入图像和姿态序列生成时间连贯的视频。
引用
@article{arxiv.2110.05458,
title = {Learning Realistic Human Reposing using Cyclic Self-Supervision with 3D Shape, Pose, and Appearance Consistency},
author = {Soubhik Sanyal and Alex Vorobiov and Timo Bolkart and Matthew Loper and Betty Mohler and Larry Davis and Javier Romero and Michael J. Black},
journal= {arXiv preprint arXiv:2110.05458},
year = {2021}
}
备注
International Conference on Computer Vision (ICCV)