中文

Multi-TGDR:一种用于微阵列实验多类分类的正则化方法

统计方法学 2014-03-05 v1

摘要

背景:随着微阵列技术日益成熟和普及,在生物统计学和生物信息学领域,选择并使用少量相关基因以实现对样本的准确分类是一个热点话题。然而,大多数已开发的算法缺乏处理多类问题的能力,而这无疑是一种常见的应用场景。在此,我们提出对一种现有的正则化算法——阈值梯度下降正则化(TGDR)进行扩展,以专门解决微阵列数据的多类分类问题。当有多个微阵列实验针对相同或相似的目标时,一种选择是使用 TGDR 的元分析版本(Meta-TGDR),它将分类任务视为具有相同结构/模型的分类器的组合,同时允许参数在不同研究间变化。然而,原始的 Meta-TGDR 扩展并未提供对独立样本进行预测的解决方案。在此,我们提出了一种明确的方法来估计由 Meta-TGDR 选出的生物标志物的整体系数。这一扩展允许更广泛的应用,并允许使用独立测试集比较 Meta-TGDR 和 TGDR 的预测性能。结果:通过实际应用,我们证明了所提出的 multi-TGDR 框架效果良好,且所选基因的数量少于所有单独二元 TGDR 的总和。此外,在经批次效应调整的合并数据上,Meta-TGDR 和 TGDR 提供了近似相同的结果。通过在每次应用中添加 Bagging 过程,保证了稳定性和良好的预测性能。结论:与 Meta-TGDR 相比,TGDR 计算耗时较少,且不需要每项研究中都包含所有类别的样本。在调整后的数据上,其预测性能与 Meta-TGDR 近似相同。因此,强烈推荐使用该方法。

关键词

引用

@article{arxiv.1307.5576,
  title  = {Multi-TGDR: a regularization method for multi-class classification in microarray experiments},
  author = {Suyan Tian and Mayte Suárez-Fariñas},
  journal= {arXiv preprint arXiv:1307.5576},
  year   = {2014}
}