面向大规模数据集的 HGR 最大相关函数的样本复杂度研究
信息论
2021-09-15 v3 math.IT
摘要
Hirschfeld-Gebelein-Rényi (HGR) 最大相关及其相应函数已被证明在许多机器学习场景中有用。本文研究了利用来自大规模数据集的训练样本,通过交替条件期望 (ACE) 算法估计 HGR 最大相关函数的样本复杂度。具体而言,我们建立了一个数学框架来刻画由真实分布计算出的最大相关函数与由 ACE 算法估计出的函数之间的学习误差。针对监督与半监督学习场景,我们给出了学习误差的误差指数的解析表达式。此外,我们证明对于大规模数据集,通过 ACE 算法学习 HGR 最大相关函数的样本复杂度的上界可用所建立的误差指数表示。进而,基于我们的理论结果,我们在总采样预算约束下研究了半监督学习中不同类型样本的采样策略,并提出了一种最大化学习误差误差指数的最优采样策略。最后,数值仿真结果支撑了我们的理论结论。
引用
@article{arxiv.1907.00393,
title = {On the Sample Complexity of HGR Maximal Correlation Functions for Large Datasets},
author = {Shao-Lun Huang and Xiangxiang Xu},
journal= {arXiv preprint arXiv:1907.00393},
year = {2021}
}
备注
Submitted to IEEE Transactions on Information Theory