中文

GloCTM:通过全局上下文空间进行跨语言主题建模

计算与语言 2026-01-21 v1

摘要

跨语言主题建模旨在发现跨语言的一致且语义对齐的主题——这是多语言理解的核心任务。然而,现有大多数模型在不相交的、语言特定的空间中学习主题,并依赖对齐机制(例如双语词典),这些机制往往无法捕捉深层的跨语言语义,导致主题空间连接松散。此外,这些方法常常忽略了嵌入在多语言预训练表示中的丰富语义信号,进一步限制了其捕捉细粒度对齐的能力。我们提出了 GloCTM(跨语言主题模型的全局上下文空间),这是一个新颖的框架,通过一个贯穿整个模型流程的统一语义空间来强制实现跨语言主题对齐。GloCTM 通过使用跨语言词汇邻域扩展词袋模型来构建丰富的输入表示,并利用局部和全局编码器推断主题比例,其潜在表示通过内部正则化进行对齐。在输出层面,基于组合词汇表定义的全局主题-词分布,在结构上同步了跨语言的主题含义。为了进一步将主题扎根于深层语义空间,GloCTM 引入了一个中心核对齐(CKA)损失,将潜在主题空间与多语言上下文嵌入对齐。在多个基准测试上的实验表明,GloCTM 显著提高了主题连贯性和跨语言对齐性,优于强大的基线模型。

关键词

引用

@article{arxiv.2601.11872,
  title  = {GloCTM: Cross-Lingual Topic Modeling via a Global Context Space},
  author = {Nguyen Tien Phat and Ngo Vu Minh and Linh Van Ngo and Nguyen Thi Ngoc Diep and Thien Huu Nguyen},
  journal= {arXiv preprint arXiv:2601.11872},
  year   = {2026}
}

备注

AAAI 2026