对 Wishart 随机矩阵的稀疏化
计算与语言
2025-11-07 v2 人工智能
信息检索
机器学习
摘要
最近的研究探索了数据稀疏化问题,这是样本分割的一个推广,其涉及将(可能为矩阵)随机变量分解为独立分量。在 随机矩阵具有独立同分布 行的特殊情况下,Dharamshi 等 (2024a) 提供了稀疏化是否可能的完整分析:简言之,若 未知,则可进行稀疏化,需满足 。然而,在某些情况下,数据分析师可能无法直接获取数据本身。例如,出于保护个人隐私,数据仓库可能仅提供概括统计信息,如样本均值和样本协方差矩阵。虽然样本均值服从高斯分布,但样本协方差矩阵(按比例缩放后)遵循 Wishart 分布,尚无稀疏化策略。本文填补了这一空白:我们展示,仅凭样本均值和样本协方差矩阵,即可生成两个具有独立 行的独立数据矩阵。这两个独立的数据矩阵可直接用于训练-测试范式,亦可用于推导独立的概括统计信息。此外,它们可以重新组合以恢复原始的样本均值和样本协方差。
引用
@article{arxiv.2502.09956,
title = {KGGen: Extracting Knowledge Graphs from Plain Text with Language Models},
author = {Belinda Mo and Kyssen Yu and Joshua Kazdan and Joan Cabezas and Proud Mpala and Lisa Yu and Chris Cundy and Charilaos Kanatsoulis and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2502.09956},
year = {2025}
}