基于信息迁移的上下文自回归语言主题模型中终身神经主题学习
信息检索
2019-10-01 v1 计算与语言
机器学习
摘要
LDA、DocNADE、iDocNADEe等主题模型在文档分析中颇为流行。然而,传统主题模型存在若干局限:(1)词袋(BoW)假设,忽略词序;(2)数据稀疏性,由于词共现有限,主题模型应用困难,导致主题不连贯;(3)缺乏以终身方式学习主题、利用历史知识(或潜在主题)并最小化灾难性遗忘的连续学习框架。本论文聚焦于在神经主题建模框架内解决上述挑战。我们提出:(1)结合主题模型与语言模型并在主题建模中引入语言结构(如词序、句法与语义特征等)的上下文主题模型;(2)将一种新颖的终身学习机制引入神经主题建模框架,以展示在连续文档集合中的持续学习并最小化灾难性遗忘。此外,我们执行选择性数据增强,以缓解在数据幻觉或重放期间对完整历史语料的依赖。
引用
@article{arxiv.1909.13315,
title = {Lifelong Neural Topic Learning in Contextualized Autoregressive Topic Models of Language via Informative Transfers},
author = {Yatin Chaudhary and Pankaj Gupta and Thomas Runkler},
journal= {arXiv preprint arXiv:1909.13315},
year = {2019}
}
备注
94 pages