在酒下言诚且脆弱:通过醉酒语言诱导检验大语言模型的安全性
计算与语言
2026-02-02 v1 人工智能
密码学与安全
机器学习
摘要
人类在酒精影响下容易产生不良行为并泄露隐私。本文探讨醉酒语言(即处于酒精影响状态下的文本)作为大语言模型(LLM)安全失效的驱动因素。我们研究了三种诱导醉酒语言的机制:基于人格的提示、因果微调和强化学习后训练。评估5个LLM时,我们观察到在JailbreakBench(即使存在防御措施)和ConfAIde上对越狱和隐私泄露的敏感性更高,这两个基准均为英文。通过结合人工评估和基于LLM的评估器,以及分析错误类别,我们的发现突显了人类酒后行为与通过醉酒语言诱导的类人化LLM之间的对应关系。醉酒语言诱导方法的简单性和高效性将其作为大语言模型安全调优的潜在对手,凸显了对大语言模型安全性的重大风险。
引用
@article{arxiv.2601.22169,
title = {In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement},
author = {Anudeex Shetty and Aditya Joshi and Salil S. Kanhere},
journal= {arXiv preprint arXiv:2601.22169},
year = {2026}
}
备注
WIP