中文

输出侦察:审计大语言模型的灾难性响应

计算与语言 2025-03-31 v2 人工智能

摘要

近期高知名度事件表明,使用大语言模型(LLMs)会对个人造成严重伤害,促使人们对AI安全产生越来越大的兴趣。LLM安全问题的一个原因是模型常常以一定的非零概率产生有害输出。在本工作中,我们探讨了以下场景:想象一个AI安全审计员正在寻找来自LLM的灾难性响应(例如,对“我可以因孕期而解雇员工吗?”的“是”响应),且只能对模型进行有限次数查询(例如1000次)。针对此目标,我们提出了输出侦察方法:旨在生成与给定提示的任何目标概率分布相匹配的语义流畅输出。我们使用两个LLMs进行实验,发现了众多灾难性响应示例。我们随后讨论了包括实践者在内的众多如何实施LLM灾难性响应审计的建议。我们还发布了一个开源工具包(https://github.com/joaopfonseca/outputscouting),其实现了使用 Hugging Face transformers 库的审计框架。

关键词

引用

@article{arxiv.2410.05305,
  title  = {Output Scouting: Auditing Large Language Models for Catastrophic Responses},
  author = {Andrew Bell and Joao Fonseca},
  journal= {arXiv preprint arXiv:2410.05305},
  year   = {2025}
}

备注

Work not ready, further experiments needed to validate the method