基于Transformer嵌入的主题连贯性比较研究
计算与语言
2026-05-29 v1 人工智能
摘要
主题建模是自然语言处理(NLP)的一个分支,旨在根据词共现模式将大型文本集合组织成连贯的组别,其中潜在 Dirichlet 分析(LDA)是最广泛使用且最具可解释性的概率方法之一。近期NLP的进步,特别是基于Transformer的语言模型,提供了改进的文档表示。也有人知道,模型规模(参数数量)对语言模型在不同预定义任务上的性能有显著影响。在本研究中,我们系统性地检验模型规模对主题质量的影响,通过在多种语料库上分析七个基于Transformer的语言模型(从如MiniLM等小型模型到如LLaMA-2等大型模型)在BERTopic管道中的性能。遵循R{"o}der等人(2015)的方法,我们使用连贯性和发散性指标评估主题质量。我们的结果表明,模型规模(从2200万到130亿参数)对主题质量几乎没有显著影响,表明小型模型可实现与大型模型相当的性能。
引用
@article{arxiv.2605.28832,
title = {A comparative study of transformer-based embeddings for topic coherence},
author = {Alex Ding and Tarun Rapaka and Willy Rodriguez and Jason Yang},
journal= {arXiv preprint arXiv:2605.28832},
year = {2026}
}