BERTopic用于印地语短文本主题建模:一项比较研究
信息检索
2025-01-08 v1 计算与语言
机器学习
摘要
随着印地语等本地语言的短文本数据在现代媒体中日益增多,对此类数据进行主题建模的稳健方法变得重要。本研究调查了BERTopic在建模印地语短文本方面的性能,这是现有研究中探索不足的领域。利用上下文嵌入,BERTopic可以捕获数据中的语义关系,使其可能比传统模型更有效,尤其对于短且多样的文本。我们使用6种不同的文档嵌入模型评估BERTopic,并将其性能与8种已建立的主题建模技术(如潜在狄利克雷分配(LDA)、非负矩阵分解(NMF)、潜在语义索引(LSI)、主题模型加法正则化(ARTM)、概率潜在语义分析(PLSA)、嵌入式主题模型(ETM)、组合主题模型(CTM)和Top2Vec)进行比较。模型通过一系列主题数量下的连贯性分数进行评估。我们的结果表明,BERTopic在从印地语短文本中捕获连贯主题方面始终优于其他模型。
引用
@article{arxiv.2501.03843,
title = {BERTopic for Topic Modeling of Hindi Short Texts: A Comparative Study},
author = {Atharva Mutsaddi and Anvi Jamkhande and Aryan Thakre and Yashodhara Haribhakta},
journal= {arXiv preprint arXiv:2501.03843},
year = {2025}
}
备注
Accepted into IndoNLP: The First Workshop on Natural Language Processing for Indo-Aryan and Dravidian Languages, collocated with COLING 2025. Set to appear in the workshop proceedings published in ACL Anthology