将预训练 Transformer 微调为变分自编码器
计算与语言
2021-11-25 v3 人工智能
摘要
文本变分自编码器(VAE)以后验坍塌而闻名,即模型的解码器学会忽略来自编码器的信号。由于已知后验坍塌会因具表现力的解码器而加剧,Transformer 作为文本 VAE 组件的采用十分有限。现有将 Transformer 引入文本 VAE 的研究(Li et al., 2020; Fang et al., 2021)利用大规模预训练来缓解后验坍塌,而若无大量计算资源,大多数研究界无法使用该技术。我们提出了一种简单的两阶段训练方案,仅通过微调即可将序列到序列 Transformer 转换为 VAE。所得语言模型在某些内部指标上与大规模预训练的基于 Transformer 的 VAE 具有竞争力,但在其他指标上有所不及。为便于训练,我们全面探讨了文献中常见后验坍塌缓解技术的影响。我们发布代码以保证可复现性。
引用
@article{arxiv.2108.02446,
title = {Finetuning Pretrained Transformers into Variational Autoencoders},
author = {Seongmin Park and Jihwa Lee},
journal= {arXiv preprint arXiv:2108.02446},
year = {2021}
}
备注
Proceedings of the Second Workshop on Insights from Negative Results in NLP