中文

通过多视图学习实现人体重定位的解耦表示

计算机视觉与模式识别 2019-12-16 v1

摘要

我们研究跨多个域的数据解耦表示学习及其在人体重定位中的应用。我们的目标是将输入图像映射到一个身份不变潜表示,以捕捉表情与姿态等内在因素。为此,我们提出一种新颖的多视图学习方法,利用图像、关键点和姿态等多种数据源。我们的模型由面向数据不同视图的多个身份条件化VAE组成。训练时,我们鼓励这些视图间的潜嵌入保持一致。我们的观察是,关键点与姿态等辅助数据包含关键的、与身份无关语义信息,且更易在这些更简单的视图上训练解耦CVAE,以将此类语义与其他身份特定属性分离。我们表明,训练多视图CVAE并鼓励潜一致性可引导图像编码保留表情与姿态语义,从而获得改进的解耦表示与更好的人体重定位结果。

关键词

引用

@article{arxiv.1912.06265,
  title  = {Towards Disentangled Representations for Human Retargeting by Multi-view Learning},
  author = {Chao Yang and Xiaofeng Liu and Qingming Tang and C. -C. Jay Kuo},
  journal= {arXiv preprint arXiv:1912.06265},
  year   = {2019}
}