中文

对 Wishart 随机矩阵的稀疏化

计算与语言 2025-11-07 v2 人工智能 信息检索 机器学习

摘要

最近的研究探索了数据稀疏化问题,这是样本分割的一个推广,其涉及将(可能为矩阵)随机变量分解为独立分量。在 n×pn \times p 随机矩阵具有独立同分布 Np(μ,Σ)N_p(\mu, \Sigma) 行的特殊情况下,Dharamshi 等 (2024a) 提供了稀疏化是否可能的完整分析:简言之,若 Σ\Sigma 未知,则可进行稀疏化,需满足 n>1n>1。然而,在某些情况下,数据分析师可能无法直接获取数据本身。例如,出于保护个人隐私,数据仓库可能仅提供概括统计信息,如样本均值和样本协方差矩阵。虽然样本均值服从高斯分布,但样本协方差矩阵(按比例缩放后)遵循 Wishart 分布,尚无稀疏化策略。本文填补了这一空白:我们展示,仅凭样本均值和样本协方差矩阵,即可生成两个具有独立 Np(μ,Σ)N_p(\mu, \Sigma) 行的独立数据矩阵。这两个独立的数据矩阵可直接用于训练-测试范式,亦可用于推导独立的概括统计信息。此外,它们可以重新组合以恢复原始的样本均值和样本协方差。

关键词

引用

@article{arxiv.2502.09956,
  title  = {KGGen: Extracting Knowledge Graphs from Plain Text with Language Models},
  author = {Belinda Mo and Kyssen Yu and Joshua Kazdan and Joan Cabezas and Proud Mpala and Lisa Yu and Chris Cundy and Charilaos Kanatsoulis and Sanmi Koyejo},
  journal= {arXiv preprint arXiv:2502.09956},
  year   = {2025}
}