中文

利用负采样改进上下文主题模型

计算与语言 2023-03-28 v1 机器学习

摘要

主题建模已成为探索大型文档集合的主导方法。近期的主题建模方法使用大型上下文语言模型与变分自编码器。本文中,我们为上下文主题模型提出一种负采样机制以提升生成主题的质量。具体而言,在模型训练期间,我们对生成的文档-主题向量进行扰动,并使用三元组损失来促使从正确文档-主题向量重建的文档与输入文档相似、且与从扰动向量重建的文档不相似。在三个公开可用基准数据集上针对不同主题数的实验表明,在大多数情况下,我们的方法相较基线提升了主题一致性。我们的模型还实现了很高的主题多样性。

关键词

引用

@article{arxiv.2303.14951,
  title  = {Improving Contextualized Topic Models with Negative Sampling},
  author = {Suman Adhya and Avishek Lahiri and Debarshi Kumar Sanyal and Partha Pratim Das},
  journal= {arXiv preprint arXiv:2303.14951},
  year   = {2023}
}

备注

Accepted at 19th International Conference on Natural Language Processing (ICON 2022)