CALM:面向大语言模型的好奇心驱动审计
人工智能
2025-01-07 v1 计算与语言
摘要
审计大型语言模型(LLM)是一项至关重要且具有挑战性的任务。本研究聚焦于对仅能访问服务接口、无法获取模型参数的黑箱型大语言模型进行审计。我们将这种审计方式视为一个黑箱优化问题,其目标是自动发现目标LLM中表现出非法、不道德或不安全行为的输入-输出对。例如,我们可能寻找一种非有害输入,使得目标LLM的响应呈现有害输出;或寻找一种输入,诱导目标LLM生成包含政治敏感人物的幻觉性响应。由于可行点稀缺、提示空间的离散性以及巨大的搜索空间,这种黑箱优化面临诸多挑战。为此,我们提出了一种基于内在动机强化学习的大语言模型好奇心驱动审计方法(CALM),通过微调LLM作为审计智能体,以发现目标LLM潜在的有害和偏差输入-输出对。CALM成功识别了涉及名人且带有贬义的完成文本,以及在黑箱设置下诱导特定人物名称的输入。本工作为审计黑箱型大语言模型提供了一条有前景的道路。我们的代码已公开于 https://github.com/x-zheng16/CALM.git。
引用
@article{arxiv.2501.02997,
title = {CALM: Curiosity-Driven Auditing for Large Language Models},
author = {Xiang Zheng and Longxiang Wang and Yi Liu and Xingjun Ma and Chao Shen and Cong Wang},
journal= {arXiv preprint arXiv:2501.02997},
year = {2025}
}
备注
Accepted by AAAI 2025 AI Alignment Track