大而不欺:语言模型对欺骗的抵抗
计算与语言
2024-12-17 v1 人工智能
机器学习
摘要
大型语言模型必须在编码于权重中的知识与来自提示的上下文信息之间取得平衡,以生成准确的回复。本文通过分析同一系列中不同容量的模型如何处理故意误导的上下文信息,来研究这种相互作用。我们的实验表明,较大的模型对欺骗性提示表现出更高的鲁棒性,展现出将提示信息与内部知识进行解释和整合的高级能力。此外,我们发现较大的模型在遵循合法指令方面优于较小的模型,这表明其鲁棒性并非源于对上下文信息的忽视。我们还表明,这种现象可能不是记忆的结果,而是源于模型在利用内部存储知识的同时,更好地利用提示中隐含的与任务相关的信息的能力。
引用
@article{arxiv.2412.10558,
title = {Too Big to Fool: Resisting Deception in Language Models},
author = {Mohammad Reza Samsami and Mats Leon Richter and Juan Rodriguez and Megh Thakkar and Sarath Chandar and Maxime Gasse},
journal= {arXiv preprint arXiv:2412.10558},
year = {2024}
}