中文

一种利用名义变量进行预测区间估计的分布自适应框架

机器学习 2015-11-23 v2

摘要

迄今为止提出的预测区间估计方法集中于输入变量为数值型的情况。在仅含名义输入变量的数据集中,我们观察到具有相同输入 xux^u 的记录,但由于系统固有噪声而具有不同实值输出。现有预测区间估计方法未采用能准确建模名义输入下此类固有噪声的表示。我们提出一种针对此类在生物学和医学中普遍存在的资料的新预测区间估计方法。我们称此方法为给定名义输入的分布自适应预测区间估计(DAPIEN),其包含四个主要阶段。首先,我们为所有唯一输入选择能最佳表示系统固有噪声的分布函数。然后,我们推断所选分布函数对所有唯一输入向量 xiux^u_i 的参数 θi\theta_i(例如 θi=[meani,variancei]\theta_i=[mean_i, variance_i]),并利用 xiu,θix^u_i, \theta_i 对生成新的对应训练集。III). 接着,我们训练一个模型以在给定新 xux_u 时预测 θ\theta。最后,一旦训练模型预测出参数 θ\theta,我们使用累积分布函数的逆为新样本计算预测区间。我们在三个合成数据集上将 DAPIEN 与常用的 Bootstrap 方法进行比较。结果表明,与 Bootstrap 相比,DAPIEN 在保持所需覆盖度的同时提供更紧致的预测区间。该工作可促进回归方法在医学和生物学中的更广泛应用,其中在输入变量为名义变量时有必要提供紧致的预测区间并保持覆盖度。

关键词

引用

@article{arxiv.1511.05688,
  title  = {A Distribution Adaptive Framework for Prediction Interval Estimation Using Nominal Variables},
  author = {Ameen Eetemadi and Ilias Tagkopoulos},
  journal= {arXiv preprint arXiv:1511.05688},
  year   = {2015}
}