中文

图像的符号解缠表示

计算机视觉与模式识别 2024-12-31 v1 人工智能 机器学习

摘要

解缠表示的思想是将数据简化为一组产生该数据的生成因子。通常,这些表示是潜在空间中的向量,其中每个坐标对应于一个生成因子。然后可以通过改变特定坐标的值来修改对象,但需要确定哪个坐标对应于所需的生成因子——这在向量表示维数较高时是困难的。在本文中,我们提出了 ArSyD(Symbolic Disentanglement Architecture,符号解缠架构),该架构将每个生成因子表示为与最终表示相同维度的向量。在 ArSyD 中,对象的表示作为生成因子向量表示的叠加得到。我们称这种表示为“符号解缠表示”。我们采用超维计算(也称为向量符号体系结构)的原则,其中符号表示为超向量,允许对其进行向量运算。通过构造实现解缠,训练时无需对底层分布作任何额外假设,模型仅以弱监督方式训练以重建图像。我们在 dSprites 和 CLEVR 数据集上研究 ArSyD,并对所学的符号解缠表示进行了全面分析。我们还提出了新的解缠度量标准,以允许使用不同维度的潜在表示进行方法比较。ArSyD 允许以可控且可解释的方式编辑对象的属性,对象的属性表示维度与对象表示维度一致。

关键词

引用

@article{arxiv.2412.19847,
  title  = {Symbolic Disentangled Representations for Images},
  author = {Alexandr Korchemnyi and Alexey K. Kovalev and Aleksandr I. Panov},
  journal= {arXiv preprint arXiv:2412.19847},
  year   = {2024}
}

备注

14 pages, 14 figures