中文

DisPositioNet:语义图像操作中姿态与身份的解耦

计算机视觉与模式识别 2022-11-11 v1 人工智能 机器学习

摘要

场景中物体及其关系的图表示(称为场景图)提供了一个精确且可辨识的接口,通过修改图中的节点或边来操作场景。尽管现有工作在修改物体的位置和姿态方面取得了可喜的成果,但场景操作往往会导致丢失一些视觉特征,如物体的外观或身份。在本工作中,我们提出了 DisPositioNet,这是一种以自监督方式学习每个物体解耦表示的模型,用于使用场景图进行图像操作的任务。我们的框架能够实现变分潜在嵌入以及图中特征表示的解耦。由于对姿态和身份等特征进行了分解,我们的方法除了能产生更逼真的图像外,还利用中间特征中的概率采样,在物体替换或添加任务中生成更多样化的图像。我们的实验结果表明,在模型潜在流形中解耦特征表示在两个公开基准上定性和定量地均优于先前的工作。项目页面:https://scenegenie.github.io/DispositioNet/

关键词

引用

@article{arxiv.2211.05499,
  title  = {DisPositioNet: Disentangled Pose and Identity in Semantic Image Manipulation},
  author = {Azade Farshad and Yousef Yeganeh and Helisa Dhamo and Federico Tombari and Nassir Navab},
  journal= {arXiv preprint arXiv:2211.05499},
  year   = {2022}
}

备注

Accepted to BMVC 2022