中文

LlaMaVAE:通过连续潜在句子空间引导大语言模型生成

计算与语言 2023-12-21 v1

摘要

深度生成神经网络,如变分自编码器,提供了从句子级潜在空间角度更好地理解和控制语言模型的机会。为了将 VAE 潜在空间的可控性与近期大语言模型 (LLM) 的 SOTA 性能相结合,我们在本工作中提出了 LlaMaVAE,它将富有表达力的编码器和解码器模型(sentenceT5 和 LlaMA)与 VAE 架构相结合,旨在为 LLM 提供更好的文本生成控制。此外,为了有条件地引导 VAE 生成,我们研究了一种基于流的可逆神经网络 (INN) 的新方法,名为 Invertible CVAE。实验结果表明,LlaMaVAE 在包括语言建模、语义文本相似度和定义建模在内的各种任务中均优于此前 SOTA 的 VAE 语言模型 Optimus。对插值和遍历实验的定性分析也表明,语义聚类程度和几何一致性有所提高,从而实现了更好的生成控制。

关键词

引用

@article{arxiv.2312.13208,
  title  = {LlaMaVAE: Guiding Large Language Model Generation via Continuous Latent Sentence Spaces},
  author = {Yingji Zhang and Danilo S. Carvalho and Ian Pratt-Hartmann and André Freitas},
  journal= {arXiv preprint arXiv:2312.13208},
  year   = {2023}
}