基于图的混合主题模型 GHTM 及孟加拉低资源语言基准数据集
计算与语言
2026-03-31 v2
摘要
主题建模是一种自然语言处理(NLP)技术,用于通过分组共现关键词来发现文本语料库中潜在主题和抽象主题。尽管在英语中广泛研究,但在孟加拉语方面仍鲜有探索,因缺乏充足资源和措施。现有孟加拉语主题建模研究缺乏标准化的评估框架,无法提供全面的基线和多样化数据集,亦未探索现代方法论方法,缺乏可复现的实现,至今仅提出了三种孟加拉语特定架构。为此,本研究提出了对传统和当代主题建模方法在三个孟加拉语数据集上的全面评估,并引入 GHTM(Graph-based Hybrid Topic Model),一种新型混合主题模型架构,战略性地整合 TF-IDF 加权的 GloVe 嵌入、图卷积网络(GCN)和非负矩阵分解(NMF)。GHTM 使用混合 TF-IDF 加权的 GloVe 嵌入表示文本文档。它构建文档相似度图,并利用 GCN 通过邻域聚合来细化表示。随后,它最终采用 NMF 对细化后的表示进行分解,以提取可解释的主题。实验结果表明,GHTM 在主题连贯性(NPMI: 0.27-0.28)和主题多样性方面优于现有方法,同时在规模各异的数据集上保持计算效率。该模型还显示出强大的跨语言泛化能力,在英语 20Newsgroups 基准数据集上超越了既定的图基模型。此外,我们还引入 NCTBText,一个来自八个学科领域的孟加拉语教科书基于数据集,包含 8,650 篇文本文档,提供了超越报纸导向孟加拉语语料库的丰富主题多样性,为未来研究提供了基准。
引用
@article{arxiv.2508.00605,
title = {GHTM: A Graph-based Hybrid Topic Modeling Approach with a Benchmark Dataset for the Low-Resource Bengali Language},
author = {Farhana Haque and Md. Abdur Rahman and Sumon Ahmed},
journal= {arXiv preprint arXiv:2508.00605},
year = {2026}
}