中文

用于无监督条件文本生成的向量袋自编码器

计算与语言 2023-02-07 v2 人工智能 机器学习

摘要

文本自编码器常通过在潜空间施加映射将属性改为期望值,以用于无监督条件文本生成。近来,Mai 等人(2020)提出 Emb2Emb,一种在自编码器嵌入空间中学习这些映射的方法。然而,他们的方法局限于具有单向量嵌入的自编码器,这限制了可保留的信息量。我们通过将其方法扩展至 Bag-of-Vectors Autoencoders(BoV-AE,向量袋自编码器)来解决此问题,后者像基于注意力的模型那样将文本编码为随文本长度增长的可变大小向量袋。这使得编码与重建比标准自编码器长得多的文本成为可能。类似于常规自编码器,我们提出正则化技术以促成在潜空间中学习有意义的运算。最后,我们调整 Emb2Emb 以适配一种将输入袋映射至输出袋的训练方案,包括一种新颖的损失函数与神经架构。我们在无监督情感迁移上的实证评估表明,我们的方法显著优于标准自编码器。

关键词

引用

@article{arxiv.2110.07002,
  title  = {Bag-of-Vectors Autoencoders for Unsupervised Conditional Text Generation},
  author = {Florian Mai and James Henderson},
  journal= {arXiv preprint arXiv:2110.07002},
  year   = {2023}
}

备注

Published at AACL 2022