中文

一种新的凸双聚类算法及其在组成型数据上的扩展

统计方法学 2021-06-09 v2

摘要

双聚类是一种强大的数据挖掘技术,可同时对矩阵格式数据集中的行(观测)与列(特征)聚类,从而能以棋盘状模式提供结果,用于广泛领域的可视化与探索性分析。过去二十年已开发多种双聚类算法,其中凸双聚类通过表述为凸优化问题可保证全局最优。另一方面,双聚类的应用未能与算法技术并行推进。例如,在日益流行的微生物组研究数据中,双聚类应用不足,可能源于每个样本的组成型约束。本稿中,我们提出一种基于 ADMM 算法、在一般设定下的新凸双聚类算法 bi-ADMM,其无需现有凸双聚类算法为可视化信息双簇所需的额外平滑步骤。此外,我们将其定制为名为 biC-ADMM 的算法,专门应对微生物组数据中的组成型约束。我们方法的关键步骤利用 Sylvester 方程推导 ADMM 算法,这在聚类研究中属新颖。所提方法的有效性通过大量数值实验与一项微生物组数据应用得以检验。

关键词

引用

@article{arxiv.2011.12182,
  title  = {A New Algorithm for Convex Biclustering and Its Extension to the Compositional Data},
  author = {Binhuan Wang and Lanqiu Yao and Jiyuan Hu and Huilin Li},
  journal= {arXiv preprint arXiv:2011.12182},
  year   = {2021}
}