基于层次贝叶斯信息准则的不完整数据因子分析因子数选择
机器学习
2022-04-21 v1 机器学习
摘要
贝叶斯信息准则(BIC)定义为观测数据对数似然减去基于样本量 的惩罚项,是完整数据因子分析中流行的模型选择准则。该定义也被建议用于不完整数据。然而,基于“完整”样本量 的惩罚项在完整与不完整数据情形下相同。对于不完整数据,变量 通常仅有 个观测,这意味着使用“完整”样本量 不合理地忽略了不完整数据固有的缺失信息量。鉴于此,我们提出了一种用于不完整数据因子分析的称为层次 BIC(HBIC)的新准则。其新颖之处在于惩罚项仅使用实际观测信息量,即 。理论上,我们证明 HBIC 是变分贝叶斯(VB)下界的大样本近似,而 BIC 是 HBIC 的进一步近似,这意味着 HBIC 具有与 BIC 一致的理论一致性。我们在合成与真实数据集上进行了实验,以评估 HBIC、BIC 及相关准则在各种缺失率下的有限样本表现。结果表明,当缺失率较小时 HBIC 与 BIC 表现相近,但当缺失率不小的时候 HBIC 更准确。
引用
@article{arxiv.2204.09086,
title = {Choosing the number of factors in factor analysis with incomplete data via a hierarchical Bayesian information criterion},
author = {Jianhua Zhao and Changchun Shang and Shulan Li and Ling Xin and Philip L. H. Yu},
journal= {arXiv preprint arXiv:2204.09086},
year = {2022}
}
备注
16 pages, 4 figures