中文

Topeax——一种集密度峰检测与词汇语义术语重要性于一体的改进型聚类主题模型

人工智能 2026-01-30 v1 计算与语言

摘要

文本聚类是当今最流行的主题建模范式,广泛应用于学术界和工业界。尽管聚类主题模型看似成功,但我们识别出Top2Vec和BERTopic中存在若干未解决的问题。首先,这些方法在发现语料库中的自然聚类方面不可靠,由于对样本大小和超参数极其敏感,默认值会导致次优行为。其次,在估计术语重要性时,BERTopic忽略了关键词到主题向量的语义距离,而Top2Vec忽略了语料库中的词频。这导致一方面出现停用词和垃圾词,导致主题不够连贯;另一方面缺乏多样性和可信度。本文介绍一种新方法,Topeax,通过检测密度估计中的峰值来发现聚类数量,并结合词汇和语义指数来获得高质量的主题关键词。Topeax在集群恢复和集群描述方面均优于Top2Vec和BERTopic,同时对样本大小和超参数变化的反应也更为稳健。

关键词

引用

@article{arxiv.2601.21465,
  title  = {Topeax -- An Improved Clustering Topic Model with Density Peak Detection and Lexical-Semantic Term Importance},
  author = {Márton Kardos},
  journal= {arXiv preprint arXiv:2601.21465},
  year   = {2026}
}

备注

14 pages, 6 figures