中文

语言模型的潜空间指南

计算与语言 2024-02-23 v1 人工智能

摘要

概念引导已成为一种廉价且简单的方法,通过探测语言模型的隐藏表示以寻找概念向量,并在推理时使用它们来扰动激活,从而控制语言模型的行为。虽然先前的工作主要集中在真实性上,但在本文中,我们将该框架扩展到更丰富的概念集,如得体性、幽默、创造力和质量,并探索当前的检测和引导策略在这些具有挑战性的设置中能在多大程度上发挥作用。为了便于评估,我们开发了一种新的概念引导指标,该指标同时考虑了概念引导的成功率以及引导模型在流畅性上的潜在退化。我们的大量实验表明,虽然真实性等一些概念更容易使用当前技术进行引导,但得体性或幽默等新概念要么仍然难以引导,需要大量调优才能起作用,甚至会出现混乱。此外,我们发现具有最佳检测准确率的探针不一定是最佳引导器,这与先前对真实性的观察相矛盾。我们的工作有必要对可检测性、可引导性和概念性质之间的相互作用进行更深入的研究,我们希望我们丰富的引导研究实验测试平台能启发更强有力的后续方法。

关键词

引用

@article{arxiv.2402.14433,
  title  = {A Language Model's Guide Through Latent Space},
  author = {Dimitri von Rütte and Sotiris Anagnostidis and Gregor Bachmann and Thomas Hofmann},
  journal= {arXiv preprint arXiv:2402.14433},
  year   = {2024}
}