基于方差-不变约束的无监督内容与风格解耦
机器学习
2025-03-18 v3 人工智能
摘要
我们提供一种无监督方法,有效地从观察序列中学习解耦的内容与风格表示。与大多数依赖于特定领域标签或知识的解耦算法不同,我们的方法基于内容与风格之间在统计层面的差异这一洞见——内容在同一样本内在不同片段之间变化较大,但在数据样本间保持不变的词汇;而风格则在同一样本内相对不变,但在不同样本间 exhibits 更大的变化。我们将这种归纳偏置整合到 encoder-decoder 架构中,并将其命名为 V3(variance-versus-invariance)。实验结果表明,V3 在多个领域和模态上都能很好地泛化,成功地学习到来自音乐音频的音高和 timbre、手写数字图像的数字和颜色,以及简单动画中的动作和角色外观等解耦的内容与风格表示。V3 在与现有无监督方法相比表现出强大的解耦性能,并在少样本适应下的 out-of-distribution generalization 方面优于监督方法。最后,在学习的内容 codebook 中出现了符号级的可解释性,使机器表示与人类知识之间展现出近乎一对一的对齐。
引用
@article{arxiv.2407.03824,
title = {Unsupervised Disentanglement of Content and Style via Variance-Invariance Constraints},
author = {Yuxuan Wu and Ziyu Wang and Bhiksha Raj and Gus Xia},
journal= {arXiv preprint arXiv:2407.03824},
year = {2025}
}