通过离散优化自动审计大语言模型
机器学习
2023-03-09 v1 计算与语言
摘要
审计大语言模型(LLM)的意外行为对于 preempt 灾难性部署至关重要,但仍具挑战性。本文中,我们将审计视为一个优化问题,自动搜索匹配期望目标行为的输入输出对。例如,我们可能旨在找到一个以“Barack Obama”开头且无毒的输入,模型将其映射为有毒输出。该优化问题难以求解,因为可行点集合稀疏、空间离散,且我们审计的语言模型是非线性且高维的。为应对这些挑战,我们引入一种离散优化算法 ARCA,其联合且高效地优化输入与输出。我们的方法自动揭示关于名人的贬损补全(例如“Barack Obama is a legalized unborn” -> “child murderer”)、生成以法语输入补全为英语输出的例子,并找到生成特定名称的输入。我们的工作提供了一种在部署前揭示模型失效模式的有前景的新工具。
引用
@article{arxiv.2303.04381,
title = {Automatically Auditing Large Language Models via Discrete Optimization},
author = {Erik Jones and Anca Dragan and Aditi Raghunathan and Jacob Steinhardt},
journal= {arXiv preprint arXiv:2303.04381},
year = {2023}
}