具有非披露性质的模型判别近最优过程
统计理论
2021-07-13 v3 应用统计
统计方法学
机器学习
统计理论
摘要
设 为与某损失 及 上两分布 相关的总体风险最小化器。模型 未知,且可通过从中抽取独立同分布样本来访问 。我们的工作受如下模型判别问题驱动:“对于给定 ,来自 和 的样本量多大时,可区分 与 这两个假设?”为全面回答该问题迈出第一步,我们首先考虑具有平方损失的良设定线性模型情形。此处我们给出了样本复杂度的匹配上下界,由 给出(至多相差常数因子);其中 为 与 间分离程度的度量, 为设计协方差矩阵的秩。随后我们将该结果沿两个方向推广:(i) 渐近情形下的通用参数模型;(ii) 弱矩假设下小样本()的广义线性模型。两种情形下均导出类似形式的样本复杂度界,同时允许模型误设。事实上,我们的检验过程仅通过经验风险的某一泛函访问 。此外,使我们达到统计置信度的观测数并不足以“分辨”两个模型——即无法以 预测精度恢复 。这两个性质使得我们的框架可用于如下应用任务:在保障模型(可能为专有)不会被识别方实际“推断”出的同时,对其加以“识别”。
引用
@article{arxiv.2012.02901,
title = {Near-Optimal Procedures for Model Discrimination with Non-Disclosure Properties},
author = {Dmitrii M. Ostrovskii and Mohamed Ndaoud and Adel Javanmard and Meisam Razaviyayn},
journal= {arXiv preprint arXiv:2012.02901},
year = {2021}
}
备注
52 pages, 2 figures; corrected the proof of the lower bound; added new applications and the Fisher information-based argument in Appendix F