中文

CLaRe:紧凑近无损高维对象数据潜在表示

统计方法学 2025-02-12 v1

摘要

潜在特征表示方法在高维复杂数据对象的降维和统计建模中发挥着重要作用。然而,现有的评估方法往往依赖于反映信息损失分布集中趋势的聚合统计量,如平均损失或总损失,这可能会掩盖单个观察值之间的差异。我们认为,仅控制平均性能不足以保证潜在空间的统计分析能反映数据生成过程,因而主张控制最坏情况的泛化误差,即泛化误差分布的尾部分位点。我们的框架 CLaRe(Compact near-lossless Latent Representations)引入了一种系统方法,在评估和选择潜在特征表示方法时,在表示的紧凑性与信息保留之间进行平衡。为便于应用 CLaRe 框架,我们开发了一个 R 包 GLaRe(Graphical Analysis of Latent Representations),实现了该框架并提供潜在表示完整泛化误差分布的图形概览。我们通过三个案例研究展示了 CLaRe 的实用性,这些研究涉及来自不同应用领域的高维数据集。我们将 CLaRe 框架应用于每个数据集的主成分、小波和自编码器表示中进行选择。案例研究表明,最佳潜在特征表示取决于数据集的特征,强调了灵活评估框架的重要性。

关键词

引用

@article{arxiv.2502.07084,
  title  = {CLaRe: Compact near-lossless Latent Representations of High-Dimensional Object Data},
  author = {Emma Zohner and Edward Gunning and Giles Hooker and Jeffrey Morris},
  journal= {arXiv preprint arXiv:2502.07084},
  year   = {2025}
}

备注

39 pages, 20 figures