中文

多站点数据集何时可合并用于回归?假设检验、$\ell_2$-一致性与神经科学应用

统计方法学 2017-09-05 v1 机器学习

摘要

生物医学与健康科学中的许多研究由于后勤或资金限制涉及小样本量。通常,识别一组预测变量与响应变量之间微弱(但科学上有趣)的关联需要合并来自多个不同实验室或组的数据集。尽管统计机器学习中有大量文献处理多站点数据集中的分布偏移与推断,但独立于我们所使用的推断算法,这种合并何时必定有帮助(以及何时无帮助)却不甚明确。本文我们提出一种假设检验来回答此问题,既适用于经典线性回归也适用于高维线性回归。我们精确识别了跨多站点合并数据集合理的情形,以及此类策略决策如何通过在任何数据传输发生前在每个站点可执行简单检查来制定。聚焦于阿尔茨海默病研究,我们给出的实证结果表明,在我们分析建议的情形下,将本地数据集与国际研究的数据合并可提高功效。

关键词

引用

@article{arxiv.1709.00640,
  title  = {When can Multi-Site Datasets be Pooled for Regression? Hypothesis Tests, $\ell_2$-consistency and Neuroscience Applications},
  author = {Hao Henry Zhou and Yilin Zhang and Vamsi K. Ithapu and Sterling C. Johnson and Grace Wahba and Vikas Singh},
  journal= {arXiv preprint arXiv:1709.00640},
  year   = {2017}
}

备注

34th International Conference on Machine Learning