中文

多任务回归预测中依赖于样本量的协变量公共子集的最优选择

统计理论 2021-09-07 v2 统计理论

摘要

分析者获得一个由不同大小的回归数据集 DjD_j 组成的训练集,这些数据集依某些 GjG_j 分布,j=1,,Jj=1,\ldots,\cal J,其中假定分布 GjG_j 构成由某共同源生成的随机样本。特别地,DjD_j 具有公共协变量集且均带标签。训练集由分析者用于选择记为 P(n){P}^*(n) 的协变量子集,其作用如下所述。我们所考虑的多任务问题为:给定若干随机带标签数据集(可在或不在训练集中)DJkD_{J_k},大小为 nkn_kk=1,,Kk=1,\ldots,K,分别对每数据集在协变量子集 P(nk){P}^*(n_k) 上估计回归系数,进而在给定其协变量时预测未来因变量。自然地,DJkD_{J_k} 的大样本量 nkn_k 允许更大的协变量子集,且所选协变量子集大小对 nkn_k 的依赖是实现良好预测并避免过拟合所必需的。子集选择素以困难、计算量大且需大样本著称;在合适假设下,将所有回归数据集在训练集中联合使用相当于借力以提升选择效果。此外,对所有具给定样本量的回归使用公共子集,使数据收集标准化、简化,并避免为每个预测任务选择并使用不同子集。我们的方法在用于预测的相关协变量对不同回归公共、而模型系数可不同时有效。

关键词

引用

@article{arxiv.2012.05949,
  title  = {Optimal selection of sample-size dependent common subsets of covariates for multi-task regression prediction},
  author = {David Azriel and Yosef Rinott},
  journal= {arXiv preprint arXiv:2012.05949},
  year   = {2021}
}