基于方差-不变性-协方差正则化的自监督神经主题模型
机器学习
2025-02-27 v1 计算与语言
摘要
在本研究中,我们提出了一种自监督神经主题模型(NTM),将NTMs的强大功能与正则化自监督学习方法相结合以提高性能。NTMs使用神经网络学习文档中单词背后隐藏的主题,从而实现更大的灵活性并能够估计更连贯的主题。另一方面,一些自监督学习方法使用具有两个相同网络的联合嵌入架构,这些网络为同一输入的两个增强版本产生相似的表示。对这些表示应用正则化以防止坍缩,这否则会导致网络对所有输入输出恒定或冗余的表示。我们的模型通过显式正则化锚�样本和正样本的隐式主题表示来提高主题质量。我们还引入了对抗数据增强方法来取代启发式抽样方法。我们进一步开发了包括基于NTM的对比学习模型,这些模型包含正负样本。在三个数据集上的实验结果表明,我们的模型在定量和定性方面都优于基线和最先进的模型。
引用
@article{arxiv.2502.09944,
title = {Self-Supervised Learning for Neural Topic Models with Variance-Invariance-Covariance Regularization},
author = {Weiran Xu and Kengo Hirami and Koji Eguchi},
journal= {arXiv preprint arXiv:2502.09944},
year = {2025}
}
备注
Preprint accepted in Springer Knowledge and Information Systems (KAIS), in press