中文

具有两个潜向量的统计模型的可辨识性:维度关系的重要性及其在图嵌入中的应用

机器学习 2024-05-31 v1 机器学习

摘要

统计模型的可辨识性是无监督表示学习中的一个关键概念。最近的非线性独立成分分析(ICA)工作利用辅助数据并建立了可辨识条件。本文提出了一个具有两个潜向量和单一辅助数据的统计模型,推广了非线性ICA,并建立了各种可辨识条件。与以往工作不同,所提模型中的两个潜向量可以具有任意维度,这一性质使我们能够在可辨识条件中揭示两个潜向量与辅助数据之间富有洞察力的维度关系。此外,令人惊讶的是,我们证明了在某些条件下,所提模型的不确定性等同于线性ICA:潜向量中的元素可以恢复至其置换和缩放。接下来,我们将可辨识性理论应用于图数据的统计模型。结果,其中一个可辨识条件包含一个吸引人的含义:统计模型的可辨识性可能取决于图数据中链接权重的最大值。然后,我们提出了一种实用的可辨识图嵌入方法。最后,我们通过数值实验表明,所提方法很好地恢复了潜向量,并且模型可辨识性明显依赖于链接权重的最大值,这支持了我们理论结果的推论。

关键词

引用

@article{arxiv.2405.19760,
  title  = {Identifiability of a statistical model with two latent vectors: Importance of the dimensionality relation and application to graph embedding},
  author = {Hiroaki Sasaki},
  journal= {arXiv preprint arXiv:2405.19760},
  year   = {2024}
}