中文

Nevermind:大语言模型中的指令覆盖与调节

计算与语言 2024-02-06 v1 人工智能 机器学习

摘要

鉴于近期大语言模型(LLMs)的惊人能力,我们调查并基准测试了最流行的专有模型和不同规模的开源模型,在冲突情境下(例如覆盖)执行显式指令的任务。这包括模型覆盖其权重内知识的能力,覆盖(或调节)提示中提取知识的能力,以及最后执行完全越狱的能力。进行的实验表明了几个改进指令遵循的关键发现——更大的模型在遵循覆盖内部和上下文指令方面表现最佳,并且非常顺从,甚至到了盲从的地步。当通过RoPE缩放扩展到更长上下文时,需要与困惑度悬崖的边缘保持显著的缓冲区,以维持指令遵循能力。最后,我们观察到,改进指令遵循,以及随后的指令覆盖/越狱,从根本上与语言模型遵循给定安全过滤器或指南的能力相悖。因此,我们推测,实现安全、可信赖AI的最有效方法应在LLM本身之外处理。

关键词

引用

@article{arxiv.2402.03303,
  title  = {Nevermind: Instruction Override and Moderation in Large Language Models},
  author = {Edward Kim},
  journal= {arXiv preprint arXiv:2402.03303},
  year   = {2024}
}

备注

11 pages