从预训练语言模型中提取潜在转向向量
计算与语言
2022-05-12 v1 人工智能
机器学习
摘要
先前关于可控文本生成的工作集中于通过学习可训练解码、巧妙提示设计或基于期望目标微调来控制语言模型。我们假设引导模型生成目标句子所需的信息已编码于模型内部。据此,我们探索一种完全不同的方法:无需微调,直接从预训练语言模型解码器中提取潜在向量。实验表明,存在转向向量,当其加入语言模型的隐藏状态时,可对来自多个领域的英文句子近乎完美地(> 99 BLEU)生成目标句子。我们展示了在 Yelp 情感基准上可利用向量算术进行无监督情感迁移,性能可与专为该任务定制的模型相媲美。我们发现转向向量间的距离在文本相似度基准(STS-B)上能反映句子相似度,优于模型的池化隐藏状态。最后,我们对转向向量的内在属性进行了分析。综上,我们的结果表明冻结的语言模型可通过其潜在转向空间被有效控制。
引用
@article{arxiv.2205.05124,
title = {Extracting Latent Steering Vectors from Pretrained Language Models},
author = {Nishant Subramani and Nivedita Suresh and Matthew E. Peters},
journal= {arXiv preprint arXiv:2205.05124},
year = {2022}
}
备注
Accepted to ACL2022 Findings; 16 pages (9 pages plus references and appendices); Code: https://github.com/nishantsubramani/steering_vectors; Some text overlap with arXiv:2008.09049