中文

潜空间变量的无监督表示方法综述

机器学习 2024-10-29 v1

摘要

本文探讨了将无监督机器学习应用于将变量表示在二维潜空间中的方法,通过应用变分自编码器(beta-VAE)。将变量表示在低维空间中允许进行数据可视化、基于底层特征对变量进行解耦、寻找有意义的模式和异常值,并支持可解释性。本文引入了五种不同的方法来表示潜空间中的变量:(1)直接转置;(2)变量的单变量元数据,如变量统计数据、经验概率密度和累计分布函数;(3)不同指标的邻接矩阵,如相关系数、R²值、Jaccard指数、余弦相似度和互信息;(4)梯度映射后进行点叉积计算;(5)组合方法。已考虑28种变量表示方法。两两点叉积解决了两个变量在潜空间轴上梯度的关系问题,如正交、正相关、负相关或介于两者之间。本文涉及覆盖特征和标签的通用变量表示。处理分类变量时,引入了强化的纠缠来表示 one-hot 编码的类别。本文包括三个示例:(1)具有已知依赖关系的合成数据;(2)手写数字的著名MNIST示例;(3)来自加拿大金融市场利率的真实世界多变量时间序列。结果表明,潜空间中利率的无监督表示能够正确地基于其类型(如债券、T票、GIC或常规抵押贷款)来解耦利率,将债券和T票沿单一曲线排列,并按其期限在该曲线上排序。

关键词

引用

@article{arxiv.2410.20172,
  title  = {Alternatives of Unsupervised Representations of Variables on the Latent Space},
  author = {Alex Glushkovsky},
  journal= {arXiv preprint arXiv:2410.20172},
  year   = {2024}
}

备注

20 pages, 15 figures, 4 tables