多任务回归预测中依赖于样本量的协变量公共子集的最优选择
统计理论
2021-09-07 v2 统计理论
摘要
分析者获得一个由不同大小的回归数据集 组成的训练集,这些数据集依某些 分布,,其中假定分布 构成由某共同源生成的随机样本。特别地, 具有公共协变量集且均带标签。训练集由分析者用于选择记为 的协变量子集,其作用如下所述。我们所考虑的多任务问题为:给定若干随机带标签数据集(可在或不在训练集中),大小为 ,,分别对每数据集在协变量子集 上估计回归系数,进而在给定其协变量时预测未来因变量。自然地, 的大样本量 允许更大的协变量子集,且所选协变量子集大小对 的依赖是实现良好预测并避免过拟合所必需的。子集选择素以困难、计算量大且需大样本著称;在合适假设下,将所有回归数据集在训练集中联合使用相当于借力以提升选择效果。此外,对所有具给定样本量的回归使用公共子集,使数据收集标准化、简化,并避免为每个预测任务选择并使用不同子集。我们的方法在用于预测的相关协变量对不同回归公共、而模型系数可不同时有效。
引用
@article{arxiv.2012.05949,
title = {Optimal selection of sample-size dependent common subsets of covariates for multi-task regression prediction},
author = {David Azriel and Yosef Rinott},
journal= {arXiv preprint arXiv:2012.05949},
year = {2021}
}