利用条件生成模型从属性控制结构化输出表示
计算机视觉与模式识别
2025-02-25 v2
摘要
结构化输出表示是计算机视觉中一种生成任务,通常需要将低维特征映射到高维结构化输出。卷积神经网络(CNN)等确定性方法中复杂空间信息的丢失,导致单一输出表示中存在不确定性和模糊结构。Sohn 等人提出了一种通过深度条件生成模型(CGM)的概率方法,其中引入并探讨了称为条件变分自编码器(CVAE)的特定模型。虽然原论文关注图像分割任务,本文采用 CVAE 框架用于通过属性进行控制输出表示的任务。该方法使我们能够学习解耦的多模态先验分布,从而实现更具可控性和鲁棒性的样本生成方法。本工作中我们重建了 CVAE 架构,并在以从两个图像数据集获得的各种属性为条件的图像上训练它:大规模名人人脸属性(CelebA)数据集和 Caltech-UCSD 鸟类(CUB-200-2011)数据集。我们尝试生成具有发色和眼镜等明显属性的新人脸,以及具有各种属性的不同鸟类物种样本。我们进一步通过对变分下界施加加权项来引入改进泛化样本生成的策略。
引用
@article{arxiv.2305.00980,
title = {Controlling Structured Output Representations from Attributes using Conditional Generative Models},
author = {Mohamed Debbagh},
journal= {arXiv preprint arXiv:2305.00980},
year = {2025}
}