用于从转录组谱中发现候选生物标志物的混合集成特征选择设计
机器学习
2021-08-03 v1 基因组学
摘要
利用基因表达数据发现疾病生物标志物已被特征选择(FS)方法极大推进,尤其是采用在数据层面扰动(即同构,Hom-EFS)或方法层面扰动(即异构,Het-EFS)的集成FS(EFS)策略。此处我们提出一种混合EFS(Hyb-EFS)设计,探索两类扰动以提升候选生物标志物的稳定性与预测能力。由此,Hyb-EFS旨在打破良好性能与单一数据集、单一算法或两者特定组合之间的关联,这对于基因组生物标志物更好的可重复性尤为有意义。我们研究了该方法对与四种癌症相关的微阵列数据的适用性,并与其他集成和单一FS方法进行了广泛比较。实验中使用了五种FS方法:Wx、对称不确定性(SU)、增益率(GR)、特征方向(GeoDE)和ReliefF。我们观察到,Hyb-EFS与Het-EFS方法削弱了大多数单一FS和Hom-EFS在不同数据集间观察到的巨大性能波动。同时,Hyb-EFS在我们领域内提升了Het-EFS的稳定性。将主要由顶级选择器(Wx、GR和SU)构成的Hyb-EFS与Het-EFS比较,我们的混合方法超越了等效的异构设计及最佳Hom-EFS(Hom-Wx)。有趣的是,Hyb-EFS产生的排序达到了更高的生物学合理性,对癌症相关基因和通路有显著高富集。因此,我们的实验暗示了所提混合EFS设计在从微阵列数据发现候选生物标志物方面的潜力。最后,我们提供了一个开源框架以支持其他领域的类似分析,既作为用户友好应用也作为纯Python包。
引用
@article{arxiv.2108.00290,
title = {A Hybrid Ensemble Feature Selection Design for Candidate Biomarkers Discovery from Transcriptome Profiles},
author = {Felipe Colombelli and Thayne Woycinck Kowalski and Mariana Recamonde-Mendoza},
journal= {arXiv preprint arXiv:2108.00290},
year = {2021}
}
备注
22 pages, 11 figures, 1 table