中文

从模式补全中学习:自监督可控生成

计算机视觉与模式识别 2024-11-08 v2 人工智能

摘要

人类大脑表现出强大的能力,能够自发地将同一或相似视觉场景的不同视觉属性联系起来,例如将素描和涂鸦与现实世界的视觉对象联系起来,通常不需要监督信息。相比之下,在人工智能领域,像 ControlNet 这样的可控生成方法严重依赖标注的训练数据集,如深度图、语义分割图和姿态,这限制了该方法的可扩展性。受可能有助于大脑联想能力的神经机制(特别是皮层模块化和海马体模式补全)的启发,我们在此提出了一种自监督可控生成框架。首先,我们引入等变约束以促进模块化自编码器网络中的模块间独立性和模块内相关性,从而实现功能特化。随后,基于这些特化模块,我们采用自监督模式补全方法进行可控生成训练。实验结果表明,所提出的模块化自编码器有效地实现了功能特化,包括对颜色、亮度和边缘检测的模块化处理,并表现出类似大脑的特征,包括方向选择性、颜色拮抗和中心-外周感受野。通过自监督训练,联想生成能力在 SCG 中自发涌现,展示了对绘画、素描和古代涂鸦等各种任务的联想生成出色的泛化能力。与之前的代表性方法 ControlNet 相比,我们提出的方法不仅在更具挑战性的高噪声场景中展现出卓越的鲁棒性,而且由于其自监督方式而具备更具前景的可扩展性潜力。代码已在 Github 和 Gitee 上发布。

关键词

引用

@article{arxiv.2409.18694,
  title  = {Learning from Pattern Completion: Self-supervised Controllable Generation},
  author = {Zhiqiang Chen and Guofan Fan and Jinying Gao and Lei Ma and Bo Lei and Tiejun Huang and Shan Yu},
  journal= {arXiv preprint arXiv:2409.18694},
  year   = {2024}
}