中文

利用主协变量回归改进样本与特征选择

化学物理 2020-12-23 v1 机器学习

摘要

从大量候选者中选择最相关的特征与样本,是自动化数据分析中经常出现的任务,其可用于提升模型的计算性能,且常能提升其可迁移性。此处我们关注为此目的而应用的两种流行的子选择方案:基于特征矩阵低秩近似的 CUR 分解,以及依赖于迭代识别最多样样本与最具判别性特征的远点采样(Farthest Point Sampling)。我们修改了这些无监督方法,按照与主协变量回归(PCovR)方法相同的思路引入了一个有监督分量。我们表明,纳入目标信息所提供的选择在监督任务中表现更好,这我们通过岭回归、核岭回归与稀疏核回归加以证明。我们还表明,纳入简单监督学习模型的某些方面可以提升更复杂模型(如前馈神经网络)的精度。我们给出了调整方案,以最小化任何子选择在执行无监督任务时可能造成的影响。我们展示了 PCov-CUR 与 PCov-FPS 选择应用于化学与材料科学所带来的显著改进,通常将实现给定回归精度所需的特征与样本数量减少为原来的二分之一。

关键词

引用

@article{arxiv.2012.12253,
  title  = {Improving Sample and Feature Selection with Principal Covariates Regression},
  author = {Rose K. Cersonsky and Benjamin A. Helfrecht and Edgar A. Engel and Michele Ceriotti},
  journal= {arXiv preprint arXiv:2012.12253},
  year   = {2020}
}