中文

使用错误学习模型时预测推断中的稳态现象:关于数据随机划分为训练集与测试集的探讨

统计理论 2020-03-23 v1 统计理论

摘要

本札记采用保角预测过程,为 Efron 教授(Efron, 2020)所讨论的关于预测、估计与 IID 假设的若干观点提供进一步支持。旨在传达以下信息:(1) 在 IID(例如训练与测试数据集的随机划分)假设下,预测确实是比估计更简单的任务,因为此时预测具有“稳态性质”——即使用于学习的模型完全错误,预测结果仍保持有效。(2) 若 IID 假设被违背(例如针对特定个体的定向预测),稳态性质常被破坏,且在错误模型下的预测结果通常无效。(3) 更好的模型估计通常能在 IID 与非 IID 情形下带来更精确的预测。良好的建模与估计实践十分重要,且在很多时候对获得良好预测结果至关重要。该讨论也为深度学习在学术练习中(通过将整体数据随机划分为训练与测试集进行实验)表现优异,却未能在真实世界应用中产生诸多“杀手级应用”提供了一项解释。

关键词

引用

@article{arxiv.2003.08989,
  title  = {Homeostasis phenomenon in predictive inference when using a wrong learning model: a tale of random split of data into training and test sets},
  author = {Min-ge Xie and Zheshi Zheng},
  journal= {arXiv preprint arXiv:2003.08989},
  year   = {2020}
}