中文

面向神经主题模型的对比学习

计算与语言 2021-10-26 v1

摘要

近期实证研究表明,对抗主题模型(ATM)可通过区分一篇文档与另一不相似样本来成功捕捉文档的语义模式。然而,利用该判别-生成架构有两个重要缺陷:(1) 该架构不关联具有相同的显著词文档-词分布的相似文档;(2) 它限制了整合外部信息(如文档情感)的能力,而后者已被证明有益于神经主题模型的训练。为解决这些问题,我们从数学分析视角重新审视对抗主题架构,提出一种将判别目标重新表述为优化问题的新方法,并设计了一种促进外部变量整合的新颖采样方法。该重新表述鼓励模型纳入相似样本间的关系,并对不相似样本间的相似性施加约束;而该基于内部输入与重建输出的采样方法,有助于告知模型对主主题有贡献的显著词。实验结果表明,在属于不同领域、词汇量和文档长度的三个常用基准数据集上,我们的框架在主题一致性方面优于其他最先进的神经主题模型。

关键词

引用

@article{arxiv.2110.12764,
  title  = {Contrastive Learning for Neural Topic Model},
  author = {Thong Nguyen and Anh Tuan Luu},
  journal= {arXiv preprint arXiv:2110.12764},
  year   = {2021}
}

备注

15 pages, 8 tables, 5 figures, published at Advances in Neural Information Processing Systems (NeurIPS), 2021