通过上下文学习揭示基础大语言模型的滥用潜力
计算与语言
2024-04-17 v1 人工智能
摘要
大语言模型(LLM)的开源加速了应用开发、创新和科学进步。这包括基础模型(在没有对齐的情况下在广泛数据集上预训练)和对齐模型(有意设计以符合伦理标准和人类价值观)。与普遍假设(即基础LLM固有的指令遵循限制可作为防止滥用的保障)相反,我们的调查揭示了这一信念中的关键疏忽。通过精心设计的演示,我们的研究表明基础LLM能够有效解释和执行恶意指令。为了系统评估这些风险,我们引入了一套新颖的风险评估指标。实证结果表明,基础LLM的输出可能表现出与为恶意目的微调的模型相当的风险水平。这种漏洞既不需要专业知识也不需要训练,几乎任何人都可以利用,突显了重大风险以及立即关注基础LLM安全协议的迫切需要。
引用
@article{arxiv.2404.10552,
title = {Unveiling the Misuse Potential of Base Large Language Models via In-Context Learning},
author = {Xiao Wang and Tianze Chen and Xianjun Yang and Qi Zhang and Xun Zhao and Dahua Lin},
journal= {arXiv preprint arXiv:2404.10552},
year = {2024}
}