中文

用调查员代理人激发语言模型行为

机器学习 2025-02-04 v1 人工智能 计算与语言

摘要

语言模型在使用自由形式文本进行提示时会表现出复杂且多样化的行为,使人们难以描述可能的输出空间。我们研究了行为激发的问题,即目标是搜索能够诱导目标语言模型产生特定特定行为(例如幻觉或有害响应)的提示。为了导航可能提示的指数级空间,我们训练调查员模型将随机选择的目标行为映射到能够激发这些行为的多样化输出分布,类似于 amortize Bayesian inference。我们通过监督微调、DPO强化学习以及一种新颖的Frank-Wolfe训练目标来实现这一点,以迭代发现多样化的提示策略。我们的调查员模型暴露出各种有效且可解释的提示,导致越狱、幻觉和开放性异常行为, 在部分AdvBench(有害行为)上实现100%攻击成功率,幻觉率达85%。

关键词

引用

@article{arxiv.2502.01236,
  title  = {Eliciting Language Model Behaviors with Investigator Agents},
  author = {Xiang Lisa Li and Neil Chowdhury and Daniel D. Johnson and Tatsunori Hashimoto and Percy Liang and Sarah Schwettmann and Jacob Steinhardt},
  journal= {arXiv preprint arXiv:2502.01236},
  year   = {2025}
}

备注

20 pages, 7 figures