中文

测量与控制语言模型对话中的指令(不)稳定性

计算与语言 2024-07-29 v4 人工智能 机器学习

摘要

系统提示是定制语言模型聊天机器人的标准工具,使其能够遵循特定指令。使用系统提示的一个隐含假设是它们将是稳定的,因此聊天机器人将在整个对话过程中继续根据规定的指令生成文本。我们提出了一个定量基准来测试这一假设,通过两个受指令聊天机器人之间的自对话来评估指令稳定性。测试 LLaMA2-chat-70B 和 GPT-3.5 等流行模型后,我们揭示了在八轮对话内存在显著的指令漂移。对这一现象的实证和理论分析表明,Transformer 注意力机制发挥了作用,这是由于长程交换中的注意力衰减。为了对抗注意力衰减和指令漂移,我们提出了一种称为 split-softmax 的轻量级方法,其与两个强基线相比表现优异。

关键词

引用

@article{arxiv.2402.10962,
  title  = {Measuring and Controlling Instruction (In)Stability in Language Model Dialogs},
  author = {Kenneth Li and Tianle Liu and Naomi Bashkansky and David Bau and Fernanda Viégas and Hanspeter Pfister and Martin Wattenberg},
  journal= {arXiv preprint arXiv:2402.10962},
  year   = {2024}
}

备注

COLM 2024; Code and data: https://github.com/likenneth/persona_drift