用于改进神经主题模型的多样性感知连贯性损失
计算与语言
2023-05-29 v2 机器学习
摘要
神经主题建模的标准方法采用变分自编码器(VAE)框架,在重构损失之外还联合最小化估计后验与先验之间的 KL 散度。由于神经主题模型是通过重建单个输入文档来训练的,它们并未显式地捕捉语料库层面上主题词之间的连贯性。在本工作中,我们提出了一种新颖的多样性感知连贯性损失,它鼓励模型学习语料库级别的连贯性分数,同时保持主题之间的高多样性。在多个数据集上的实验结果表明,我们的方法显著提升了神经主题模型的性能,且无需任何预训练或额外参数。
引用
@article{arxiv.2305.16199,
title = {Diversity-Aware Coherence Loss for Improving Neural Topic Models},
author = {Raymond Li and Felipe González-Pizarro and Linzi Xing and Gabriel Murray and Giuseppe Carenini},
journal= {arXiv preprint arXiv:2305.16199},
year = {2023}
}
备注
Minor Fixes, 11 pages, Camera-Ready for ACL 2023 (Short Paper)