中文

马尔可夫链混合模型中的近最优聚类

机器学习 2026-03-18 v3 信息论 机器学习 math.IT 概率论

摘要

我们研究对 TT 条长度为 HH 的轨迹进行聚类的问题,每条轨迹由大小为 SS 的有限状态空间上 KK 个未知遍历马尔可夫链中的一个生成。我们推导出了一个依赖于实例的、高概率的聚类错误率下界,该下界由转移核之间的平稳加权 KL 散度控制。随后,我们提出了一种两阶段算法:阶段 I 通过一种新的遍历马尔可夫链单射欧几里得嵌入应用谱聚类,这是一个具有独立研究价值的贡献,能够得到锐利的集中度结果;阶段 II 通过单次基于似然的重新分配步骤来细化聚类。我们证明,在关于 TTHH 的合理要求下,我们的算法以高概率实现近最优的聚类错误率。初步实验支持了我们的方法,我们最后讨论了其局限性与扩展。

关键词

引用

@article{arxiv.2506.01324,
  title  = {Near-Optimal Clustering in Mixture of Markov Chains},
  author = {Junghyun Lee and Yassir Jedra and Alexandre Proutière and Se-Young Yun},
  journal= {arXiv preprint arXiv:2506.01324},
  year   = {2026}
}

备注

AISTATS 2026 (50 pages, 6 figures) (ver3: camera-ready version, major revisions)