中文

质疑半监督变分自编码器框架在文本分类中的适用性

计算与语言 2021-09-28 v1 机器学习

摘要

半监督变分自编码器(SSVAE)是广泛用于数据高效学习的模型。在本文中,我们质疑序列SSVAE在标准设计上对于文本分类任务的适用性,并指出两种过度复杂性来源,为此我们提供了简化方案。这些对SSVAE的简化保留了其理论合理性,同时在训练结果为文本分类器的半监督设定下带来若干实际优势。这些简化包括从目标函数中移除(i)Kullback-Leibler散度,以及从概率模型中移除(ii)完全未观测潜变量。这些改变使用户无需为潜变量选择先验,使模型更小更快,并允许信息更好地流入潜变量。我们在4个文本分类任务上将简化版本与标准SSVAE进行比较。除上述简化外,实验显示了26%的加速,同时保持同等的分类分数。用于复现实验的代码已公开。

关键词

引用

@article{arxiv.2109.12969,
  title  = {Challenging the Semi-Supervised VAE Framework for Text Classification},
  author = {Ghazi Felhi and Joseph Le Roux and Djamé Seddah},
  journal= {arXiv preprint arXiv:2109.12969},
  year   = {2021}
}

备注

Accepted at the EMNLP 2021 Workshop on Insights from Negative Results