中文

面向基因组数据集的高维特征选择

机器学习 2021-05-19 v2 定量方法 机器学习

摘要

机器学习和模式识别中的一个核心问题是识别最重要特征的过程。在本文中,我们提供一种新的特征选择方法(DRPT),其首先去除不相关特征,然后检测剩余特征之间的相关性。令D=[Ab]D=[A\mid \mathbf{b}]为一个数据集,其中b\mathbf{b}为类标签,AA为列对应特征的矩阵。我们使用最小二乘法和AA的伪逆求解Ax=bA\mathbf{x} = \mathbf{b}x\mathbf{x}的每个分量可视为对应列(特征)的分配权重。我们基于x\mathbf{x}的局部极大值定义阈值,并去除权重小于该阈值的那些特征。为检测我们仍称为AA的约简矩阵中的相关性,我们考虑AA的一个扰动A~\tilde A。我们证明相关性编码于Δx=xx~\Delta\mathbf{x}=\mid \mathbf{x} -\tilde{\mathbf{x}}\mid 中,其中x~\tilde{\mathbf{x}}A~x~=b\tilde A\tilde{\mathbf{x}}=\mathbf{b}的最小二乘解。我们首先基于Δx\Delta\mathbf{x}聚类特征,然后利用特征的熵进行聚类。最后,根据权重和熵从每个子簇中选出一个特征。DRPT的有效性已通过在10个基因数据集(特征数从9,117到267,604不等)上与七种最先进特征选择方法的一系列比较得到验证。结果表明,总体而言,DRPT在多个方面相较于每种特征选择算法均具有良好性能。

关键词

引用

@article{arxiv.2002.12104,
  title  = {High-Dimensional Feature Selection for Genomic Datasets},
  author = {Majid Afshar and Hamid Usefi},
  journal= {arXiv preprint arXiv:2002.12104},
  year   = {2021}
}