重新思考内容与风格:探索无监督解耦中的偏置
计算机视觉与模式识别
2021-09-06 v2 人工智能
机器学习
摘要
内容与风格(C-S)解耦旨在将对象潜在的解释性因素分解为两个独立的子空间。从无监督解耦视角,我们重新思考内容与风格,并基于我们的假设——不同因素对图像重建的重要性和普遍性不同,这构成了一种数据偏置——提出了一种无监督 C-S 解耦的公式。我们所提出的 C-S 解耦模块(C-S DisMo)引入了相应的模型归纳偏置,其在逼近真实数据分布时为内容和风格分配不同且独立的角色。具体而言,数据集中每个内容嵌入编码了图像重建最主要因素,被假定为从跨数据集的共享分布中采样;特定图像的风格嵌入编码剩余因素,用于通过仿射变换定制该共享分布。在多个流行数据集上的实验表明,我们的方法实现了最先进的无监督 C-S 解耦,可与甚至有监督方法相媲美或更优。我们通过下游任务验证了方法的有效性:域翻译与单视图 3D 重建。项目主页见 https://github.com/xrenaa/CS-DisMo。
引用
@article{arxiv.2102.10544,
title = {Rethinking Content and Style: Exploring Bias for Unsupervised Disentanglement},
author = {Xuanchi Ren and Tao Yang and Yuwang Wang and Wenjun Zeng},
journal= {arXiv preprint arXiv:2102.10544},
year = {2021}
}
备注
Project Page: https://github.com/xrenaa/CS-DisMo