基于惩罚模糊C均值方法的基因表达数据分析
计算机视觉与模式识别
2013-02-14 v1 计算工程、金融与科学
摘要
随着微阵列技术的快速发展,大量高维基因表达数据不断产生,这带来了显著的计算挑战。应对这一挑战的第一步是使用聚类技术,这在数据挖掘过程中对于揭示自然结构和识别底层数据中的有趣模式至关重要。本文提出了一种鲁棒的基因表达聚类方法,以最小化不良聚类。文中描述了惩罚模糊C均值(PFCM)聚类算法,并将其与最具代表性的离线聚类技术:K均值聚类、粗糙K均值聚类和模糊C均值聚类进行了比较。这些技术在一个脑肿瘤基因表达数据集上进行了实现和测试。通过定性验证实验对所提方法的性能进行了分析。从实验结果可以看出,惩罚模糊C均值算法显示出比我们比较研究中使用的其他投影聚类算法高得多的可用性。使用脑肿瘤基因表达数据集展示了显著且有前景的聚类结果。因此,在全基因组表达实验中观察到的模式可以解释为细胞过程状态的指示。在这些聚类结果中,我们发现惩罚模糊C均值算法为肿瘤学诊断提供了有用的辅助信息。
引用
@article{arxiv.1302.3123,
title = {An Analysis of Gene Expression Data using Penalized Fuzzy C-Means Approach},
author = {P. K. Nizar Banu and H. Hannah Inbarani},
journal= {arXiv preprint arXiv:1302.3123},
year = {2013}
}
备注
14; IJCCI, Vol. 1, Issue 2,(January-July)2011