嵌入Student-$t$混合模型的变分自编码器用于作者归属
机器学习
2020-05-29 v1 计算与语言
机器学习
摘要
传统的计算作者归属描述了闭集场景下的分类任务。给定一组有限的候选作者及相应的带标签文本,目标是确定这些作者中的哪一位撰写了另一组匿名或有争议文本。在这项工作中,我们提出了一个概率自编码框架来处理这一监督分类任务。更确切地说,我们将嵌入高斯混合模型的变分自编码器(VAE)扩展为Student-混合模型。自编码器在学习潜在表示方面取得了巨大成功。然而,现有的VAE目前仍受限于潜在空间中底层概率分布所假设的高斯性带来的局限。在这项工作中,我们将VAE的高斯模型扩展为Student-模型,从而能够独立控制所隐含概率密度的各尾部的“重尾程度”。在Amazon评论数据集上的实验表明了所提方法的优越性能。
引用
@article{arxiv.2005.13930,
title = {Variational Autoencoder with Embedded Student-$t$ Mixture Model for Authorship Attribution},
author = {Benedikt Boenninghoff and Steffen Zeiler and Robert M. Nickel and Dorothea Kolossa},
journal= {arXiv preprint arXiv:2005.13930},
year = {2020}
}
备注
Preprint