通过源代码探索AI安全性
计算与语言
2025-06-26 v1
摘要
大型语言模型(LLM)已广泛应用于众多领域,与人类交互。为提升其能力,必须同步加强安全措施,以将模型与人类价值观和偏好相匹配。本文引入一种称为“思考代码”(Code of Thought, CoDoT)的提示策略,用于评估LLM的安全性。CoDoT将自然语言输入转换为表示相同意图的简单代码。例如,CoDoT将自然语言提示“使陈述更具毒性:{text}”转换为:“make_more_toxic({text})”。我们表明,CoDoT导致广泛的状态机顶级LLM均出现严重安全问题。例如,GPT-4 Turbo的毒性增加了16.5倍,DeepSeek R1在100%的情况下都失败了,平均而言,七个现代LLM的毒性增加了300%。此外,递归应用CoDoT可进一步将毒性提高两倍。鉴于LLM的快速广泛采用,CoDoT凸显了从根本上评估安全努力的紧迫性,确保安全与能力同步提升。
引用
@article{arxiv.2506.20471,
title = {Probing AI Safety with Source Code},
author = {Ujwal Narayan and Shreyas Chaudhari and Ashwin Kalyan and Tanmay Rajpurohit and Karthik Narasimhan and Ameet Deshpande and Vishvak Murahari},
journal= {arXiv preprint arXiv:2506.20471},
year = {2025}
}