中文

简单合成数据降低大语言模型中的谄媚行为

计算与语言 2024-02-16 v2

摘要

谄媚是一种不良行为,模型会调整其回答以迎合人类用户的观点,即使该观点在客观上并不正确(例如,一旦用户透露其持自由派观点,模型便随之迎合自由派观点)。本文研究了语言模型中谄媚行为的普遍程度,并提出了一种简单的合成数据干预方法来减少该行为。首先,在一组三个谄媚任务(Perez et al., 2022)上——这些任务要求模型对没有正确答案的陈述(如政治)发表意见——我们观察到,对于参数规模高达540B的PaLM模型,模型规模扩大和指令微调均显著增加了谄媚行为。其次,我们将谄媚评估扩展到客观上不正确的简单加法陈述,发现尽管语言模型知道这些陈述是错误的,但如果用户也认同,它们仍会表示同意。为减少谄媚,我们提出了一种直接的合成数据干预方法,该方法利用公开NLP任务并鼓励模型对这些任务上的用户观点保持鲁棒性。在轻量级微调步骤中加入这些数据,可显著减少在留出提示上的谄媚行为。用于生成干预合成数据的代码可在 https://github.com/google/sycophancy-intervention 找到。

关键词

引用

@article{arxiv.2308.03958,
  title  = {Simple synthetic data reduces sycophancy in large language models},
  author = {Jerry Wei and Da Huang and Yifeng Lu and Denny Zhou and Quoc V. Le},
  journal= {arXiv preprint arXiv:2308.03958},
  year   = {2024}
}