中文

基于自适应维度约简的嵌入聚类主题提取方法——TopiCLEAR

计算与语言 2025-12-09 v1

摘要

社交媒体平台如 X(前身为 Twitter)、Facebook 和 Reddit 的快速扩张,使大规模分析公共意见成为可能,涵盖社会议题、政治、自然灾害和消费情感等方面。主题建模是一种广泛使用的方法,用于揭示文本数据中的潜在主题,通常被建模为无监督分类任务。然而,传统模型最初为较长且更正式的文档设计,面对短社交媒体帖子时,由于共现统计有限、语义碎片化、拼写不一致和非正式语言等挑战,难以胜任。为此,我们提出一种新方法,TopiCLEAR:基于自适应维度约简的嵌入聚类主题提取。具体而言,对每段文本使用 Sentence-BERT (SBERT) 进行嵌入,并使用高斯混合模型 (GMM) 进行初始聚类。然后,通过基于线性判别分析的监督投影迭代细化聚类,直至收敛。值得注意的是,我们的方法直接作用于原始文本,无需诸如停用词删除等预处理步骤。我们在四个多样化的数据集上进行评估:20News、AgNewsTitle、Reddit 和 TweetTopic,每个数据集都包含人工标注的主题信息。与七个基线方法(包括最近的基于 SBERT 的方法和零-shot 生成式 AI 方法)相比,我们的方法在与人工标注主题的相似性方面取得最高水平,对社交媒体帖子和在线新闻文章均实现显著提升。此外,定性分析表明,我们的方法产生的主题更具可解释性,凸显其在社交媒体数据和网页内容分析中的潜在应用。

关键词

引用

@article{arxiv.2512.06694,
  title  = {TopiCLEAR: Topic extraction by CLustering Embeddings with Adaptive dimensional Reduction},
  author = {Aoi Fujita and Taichi Yamamoto and Yuri Nakayama and Ryota Kobayashi},
  journal= {arXiv preprint arXiv:2512.06694},
  year   = {2025}
}

备注

15 pages, 4 figures, code available at https://github.com/aoi8716/TopiCLEAR