中文

用离散变分自编码器解耦自然语言中的生成因子

计算与语言 2021-09-16 v1

摘要

学习解耦表示的能力是可解释NLP系统的重大进展,因为它允许对潜在语言特征进行控制。大多数解耦方法依赖连续变量,无论图像还是文本皆然。我们认为,尽管连续变量适用于图像数据集,但由于文本中多数生成因子是离散的,其可能并非建模文本数据特征的理想选择。我们提出一种基于变分自编码器的方法,将语言特征建模为离散变量,并鼓励变量间独立以学习解耦表示。所提模型在多项解耦的定性与定量基准以及文本风格迁移下游应用上均优于连续与离散基线。

关键词

引用

@article{arxiv.2109.07169,
  title  = {Disentangling Generative Factors in Natural Language with Discrete Variational Autoencoders},
  author = {Giangiacomo Mercatali and André Freitas},
  journal= {arXiv preprint arXiv:2109.07169},
  year   = {2021}
}

备注

Findings of EMNLP 2021