中文

一种灵活的基于预测的无模型特征排序框架

统计方法学 2021-12-01 v3

摘要

尽管存在大量用于联合特征建模的统计与机器学习工具,许多科学家仍边际地(即一次一个特征)研究特征。这部分源于训练与传统,也根植于科学家对简单可视化与可解释性的强烈兴趣。因此,在某些预测任务(例如癌症驱动基因预测)中,边际特征排序在科学发现过程中被广泛实践。本工作中,我们关注二分类预测的边际排序,这可谓最常见的预测任务。我们认为最广泛使用的边际排序准则,包括 Pearson 相关、两样本 t 检验与两样本 Wilcoxon 秩和检验,并未充分考虑特征分布与预测目标。为弥补这一实践缺口,我们提出对应于两个预测目标的两个排序准则:经典准则(CC)与 Neyman-Pearson 准则(NPC),二者均使用无模型非参数实现以适配多样的特征分布。理论上,我们证明在正则条件下,两个准则都以高概率实现与总体层面对应准则一致的样本层面排序。此外,当样本中两类比例偏离总体比例时,NPC 对采样偏差具有鲁棒性。这一性质使 NPC 在采样偏差普遍的生物医学研究中具备良好潜力。我们在模拟与真实数据研究中展示了 CC 与 NPC 的使用及其相对优势。我们这种无模型、基于目标的排序思想可扩展至特征子集排序,并推广至其他预测任务与学习目标。

关键词

引用

@article{arxiv.1903.05262,
  title  = {A flexible model-free prediction-based framework for feature ranking},
  author = {Jingyi Jessica Li and Yiling Chen and Xin Tong},
  journal= {arXiv preprint arXiv:1903.05262},
  year   = {2021}
}