中文

LLM 作为注意力感知的神经主题模型与长文本生成:可解释性与长程上下文能力

计算与语言 2026-04-15 v2 人工智能

摘要

主题建模旨在从语料库中生成可解释的主题表示和主题-文档对应关系,但经典的神经主题模型 (NTM) 仍受限于表示假设不足和语义抽象能力有限。我们从白盒和黑盒视角研究基于大语言模型 (LLM) 的主题建模。对于白盒 LLM,我们提出一种注意力感知框架,恢复类似于 NTM 中的可解释结构,包括文档-主题分布和主题-词分布。这一工作验证了 LLM 可作为注意力感知的 NTM。对于黑盒 LLM,我们将主题建模重新表述为结构化长输入任务,引入基于多样化主题线索和混合检索的后生成信号补偿方法。实验表明,恢复的注意力结构支持有效的主题分配和关键词提取,而黑盒长上下文 LLM 的性能在基线中取得竞争甚至更好的成绩。这些发现表明 LLM 与 NTM 之间存在联系,突显了长程上下文 LLM 在主题建模中的潜力。

关键词

引用

@article{arxiv.2510.03174,
  title  = {LLM as Attention-Informed NTM and Topic Modeling as long-input Generation: Interpretability and long-Context Capability},
  author = {Xuan Xu and Zhongliang Yang and Haolun Li and Beilin Chu and Rui Tian and Yu Li and Shaolin Tan and Linna Zhou},
  journal= {arXiv preprint arXiv:2510.03174},
  year   = {2026}
}