中文

函数数据分类中的变量选择:一种极大值搜索方案

统计方法学 2016-08-09 v3

摘要

本文考虑函数数据 {X(t), t[0,1]}\{X(t),\ t\in[0,1]\} 的监督二分类背景下的变量选择问题。此处“变量选择”指任何降维方法,其将完整轨迹 {X(t), t[0,1]}\{X(t),\ t\in[0,1]\} 替换为低维向量 (X(t1),,X(tk))(X(t_1),\ldots,X(t_k)),同时保持相似的分类误差。我们提出的变量选择方案基于选取函数 VX2(t)=V2(X(t),Y){\mathcal V}_X^2(t)={\mathcal V}^2(X(t),Y) 的局部极大值 (t1,,tk)(t_1,\ldots,t_k) 这一思想,其中 V{\mathcal V} 表示 Sz\'ekely、Rizzo 和 Bakirov (2007) 提出的随机变量“距离协方差”关联性度量。该方法提供了一种简单自然的方式来处理变量选择中典型出现的相关性与冗余性之间的权衡。本文包括:(a) 一些理论动机:展示了关于 VX2{\mathcal V}_X^2 极大值的一致估计结果;我们还展示了底层过程 X(t)X(t) 的不同理论模型,在这些模型下相关信息集中于 VX2{\mathcal V}_X^2 的极大值处。(b) 一项广泛的实证研究,包含约 400 个模拟模型和真实数据示例,旨在将我们的变量选择方法与其他标准的降维方案进行比较。

关键词

引用

@article{arxiv.1309.6697,
  title  = {Variable selection in functional data classification: a maxima-hunting proposal},
  author = {José R. Berrendero and Antonio Cuevas and José L. Torrecilla},
  journal= {arXiv preprint arXiv:1309.6697},
  year   = {2016}
}