模糊 C-均值聚类中的歧义驱动:如何检测不确定的聚类记录
人工智能
2017-05-31 v1 计算机视觉与模式识别
摘要
作为一种众所周知的聚类算法,模糊 C-均值 (FCM) 允许每个输入样本属于多个簇,从而比非模糊聚类方法提供更大的灵活性。然而,FCM 的准确性会受到由噪声记录、特征选择薄弱以及算法在某些情况下置信度低所引起的误检的影响。这些误检在网络安全和医疗诊断等决策应用领域至关重要,因为基于此类误检的薄弱决策可能导致灾难性后果。它们主要源于对证据不足以做出良好决策的记录子集进行决策。在本文中,我们提出了一种通过引入置信因子来减少无效检测的 FCM 歧义记录检测方法。该方法使我们能够将检测到的歧义记录发送至另一种判别方法进行更深入调查,从而通过降低错误率来提高准确性。大多数记录仍能以低错误率快速处理,从而避免了与类似混合方法相比的性能损失。在来自不同领域的多个数据集上应用所提方法的实验结果表明,错误率显著降低,同时算法的灵敏度得到提高。
引用
@article{arxiv.1409.2821,
title = {Ambiguity-Driven Fuzzy C-Means Clustering: How to Detect Uncertain Clustered Records},
author = {Meysam Ghaffari and Nasser Ghadiri},
journal= {arXiv preprint arXiv:1409.2821},
year = {2017}
}