中文

基于序列信息瓶颈方法的文档聚类

信息检索 2010-04-13 v1

摘要

本文阐述了主方向分裂划分 (PDDP) 算法并描述了其缺点,引入了主方向分裂划分 (PDDP) 算法的组合框架,然后描述了称为球面高斯期望最大化 (sGEM) 算法的简化版期望最大化算法,以及信息瓶颈方法 (IB) 作为一种寻求准确性、复杂度和时空效率的技术。PDDP 算法使用垂直于由协方差矩阵导出的主方向的超平面,递归地将数据样本分裂为两个子簇,这是该算法的核心逻辑。然而,PDDP 算法可能产生较差的结果,尤其是在簇之间没有很好地分离时。为了提高聚类结果的质量,通过使用不同设置的 IB 算法重新分配新的簇成员关系来解决该问题。IB 方法能提供准确性,但时间消耗更大。此外,基于 sGEM 算法和序列信息瓶颈方法 (sIB) 的理论背景,可以很自然地扩展该框架以涵盖使用贝叶斯信息准则估计簇数量的问题。实验结果通过与现有算法的比较,展示了所提算法的有效性。

关键词

引用

@article{arxiv.1004.1796,
  title  = {Document Clustering using Sequential Information Bottleneck Method},
  author = {P. J. Gayathri and S. C. Punitha and M. Punithavalli},
  journal= {arXiv preprint arXiv:1004.1796},
  year   = {2010}
}

备注

IEEE Publication format, ISSN 1947 5500, http://sites.google.com/site/ijcsis/