中文

图对比主题模型

计算与语言 2023-07-06 v1

摘要

现有结合对比学习的神经主题模型(NTM)因基于词频的采样策略而存在样本偏差问题,可能导致与原型语义相似的错误负样本。本文旨在探索 NTM 中高效采样策略与对比学习以解决上述问题。我们提出新采样假设:负样本应包含与原型语义无关的词。基于此,我们提出图对比主题模型(GCTM),其利用基于图的采样策略(借助文档与词间深层相关与无关性生成)所产生的信息性正、负样本进行图对比学习(GCL)。在 GCTM 中,我们首先将输入文档建模为文档-词二部图(DWBG),并构建由图神经网络编码的正、负词共现图(WCG)以表达词间深层语义相关与无关性。基于 DWBG 与 WCG,我们设计文档-词信息传播(DWIP)过程,依据文档与词间的多跳相关/无关性对 DWBG 进行边扰动。由此得到所需负样本与正样本,将与原型一同用于 GCL,以改进文档主题表示与潜在主题的学习。我们进一步表明 GCL 可解释为结构化变分图自编码器,其最大化 DWBG 上不同视角潜在主题表示的互信息。在多个基准数据集上的实验证明了本方法相较现有 SOTA 方法在主题一致性与文档表示学习上的有效性。

关键词

引用

@article{arxiv.2307.02078,
  title  = {Graph Contrastive Topic Model},
  author = {Zheheng Luo and Lei Liu and Qianqian Xie and Sophia Ananiadou},
  journal= {arXiv preprint arXiv:2307.02078},
  year   = {2023}
}

备注

17 pages, 4 figures