主题模型中相似性与相关性的解耦
计算与语言
2026-03-12 v1
摘要
大型语言模型的近期发展推动了将预训练语言模型(PLM)嵌入整合到主题模型中的趋势,这从根本上改变了主题如何捕捉语义结构的方式。经典模型如潜在 Dirichlet 分布(LDA)是从词共现统计中派生主题,而 PLM 增强型模型则将这些统计量锚定在预训练嵌入空间中,施加一种也倾向于对语义相似词进行聚类的先验。这种结构差异可以由心理语言学维度——主题词的语义相关性和分类相似性——来捕捉。为在主题模型中解耦这些维度,我们构建了一个使用大型语言模型进行注释的大型合成基准测试,用以训练一个神经评分函数。我们将此评分器应用于多个语料库和主题模型家族的全面评估,揭示了不同模型家族在其主题中捕获不同语义结构。我们进一步展示了,相似性和相关性分数成功预测了根据任务需求的下游任务性能。本文将相似性和相关性确立为主题模型评估的基本轴,并提供了一种可靠的管道,用于在模型家族和语料库之间对其进行特征化。
引用
@article{arxiv.2603.10619,
title = {Disentangling Similarity and Relatedness in Topic Models},
author = {Hanlin Xiao and Mauricio A. Álvarez and Rainer Breitling},
journal= {arXiv preprint arXiv:2603.10619},
year = {2026}
}
备注
22 pages, 6 figures, 14 tables