发现语言模型中的禁止话题
计算与语言
2025-06-12 v3 人工智能
机器学习
摘要
拒绝发现是识别语言模型拒绝讨论的全部话题的任务。我们引入这一新问题设定,并开发了一种拒绝发现方法——迭代预填充爬虫(IPC),利用令牌预填充来发现禁止话题。我们在具有公开安全调优数据的开源模型 Tulu-3-8B 上对 IPC 进行了基准测试。我们的爬虫在1000个提示的预算内成功检索到36个话题中的31个。接下来,我们将爬虫扩展到前沿模型,利用 Claude-Haiku 的预填充选项。最后,我们爬取了三个广泛使用的开放权重模型:Llama-3.3-70B 及其两个针对推理进行微调的变体——DeepSeek-R1-70B 和 Perplexity-R1-1776-70B。DeepSeek-R1-70B 展现出与审查调优一致的模式:该模型表现出"思维抑制"行为,表明其记忆了与 CCP 对齐的响应。尽管 Perplexity-R1-1776-70B 对审查具有鲁棒性,但 IPC 在量化模型中引发了与 CCP 对齐的拒绝回答。我们的发现强调了拒绝发现方法对于检测 AI 系统的偏差、边界和对齐失败的迫切需求。
引用
@article{arxiv.2505.17441,
title = {Discovering Forbidden Topics in Language Models},
author = {Can Rager and Chris Wendler and Rohit Gandikota and David Bau},
journal= {arXiv preprint arXiv:2505.17441},
year = {2025}
}