中文

通过主题级对比学习提升神经主题模型可解释性

人工智能 2024-12-24 v1

摘要

数据挖掘和知识发现是从海量数据集中提取宝贵洞见的关键方面。神经主题模型(NTMs)已成为该领域的重要无监督工具。然而,NTMs中以最大化数据似然性为主目标的做法,往往与数据挖掘和知识发现的核心目标——从大数据存储库中揭示可解释性洞见不符。过度强调似然最大化而不引入主题正则化,可能导致主题建模的潜在空间过于扩张。本文提出了一种创新方法,解决上述误差,通过引入对比学习措施评估主题可解释性。我们提出了名为ContraTopic的新型NTM框架,该框架集成了一种能够在训练过程中评估多方位主题可解释性的可微分正则化器。该正则化器采用独特的主题级对比方法,既促进主题内部的内部一致性,又确保主题间的清晰外部区分。在三个多样化数据集上进行的全面实验表明,我们的方法在可解释性方面 consistently 优于当前最先进的NTMs。

关键词

引用

@article{arxiv.2412.17338,
  title  = {Enhancing Topic Interpretability for Neural Topic Modeling through Topic-wise Contrastive Learning},
  author = {Xin Gao and Yang Lin and Ruiqing Li and Yasha Wang and Xu Chu and Xinyu Ma and Hailong Yu},
  journal= {arXiv preprint arXiv:2412.17338},
  year   = {2024}
}