潜在表示至关重要:一次性绘画任务中类人草图
计算机视觉与模式识别
2024-11-06 v2
摘要
人类可以毫不费力地从单个范例中绘制出新类别,这一直是生成模型面临的长期挑战。然而,随着扩散模型的最新进展,这一差距开始缩小。这种一次性绘画任务需要强大的归纳偏置,而这一点尚未得到系统研究。在此,我们研究了不同的归纳偏置如何塑造潜在扩散模型(LDM)的潜在空间。除了标准的LDM正则化器(KL和向量量化),我们还探索了监督正则化(包括分类和基于原型的表示)以及对比归纳偏置(使用SimCLR和冗余减少目标)。我们证明,采用冗余减少和基于原型的正则化的LDM能生成近乎类人的草图(在样本的可识别性和原创性方面)——更好地模仿了人类感知(通过心理物理学评估)。总体而言,我们的结果表明,在一次性绘画任务中,人类与机器之间的差距几乎已经弥合。
引用
@article{arxiv.2406.06079,
title = {Latent Representation Matters: Human-like Sketches in One-shot Drawing Tasks},
author = {Victor Boutin and Rishav Mukherji and Aditya Agrawal and Sabine Muzellec and Thomas Fel and Thomas Serre and Rufin VanRullen},
journal= {arXiv preprint arXiv:2406.06079},
year = {2024}
}