面向大型语言模型的好奇心驱动红队测试
机器学习
2024-03-01 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)在许多自然语言应用中潜力巨大,但存在生成不正确或有毒内容的风险。为了探究LLM何时生成不良内容,当前的范式是招募人类测试者组成“红队”,设计输入提示(即测试用例)以引发LLM产生不良响应。然而,仅依赖人类测试者成本高昂且耗时。近期的工作通过使用强化学习(RL)训练一个独立的红队LLM来自动化红队测试,以生成能最大化引发目标LLM不良响应概率的测试用例。然而,当前的RL方法仅能生成少量有效测试用例,导致对能引发目标LLM不良响应的提示空间的覆盖率较低。为克服这一局限,我们将增加生成测试用例覆盖率的问题与经过充分研究的、以新颖性为优化目标的好奇心驱动探索联系起来。我们的好奇心驱动红队测试(CRT)方法在保持或提升现有方法有效性的同时,实现了对测试用例的更高覆盖率。我们的方法CRT成功诱发了经过大量人类偏好微调以避免有毒输出的LLaMA2模型产生有毒响应。代码可在\url{https://github.com/Improbable-AI/curiosity_redteam}获取。
引用
@article{arxiv.2402.19464,
title = {Curiosity-driven Red-teaming for Large Language Models},
author = {Zhang-Wei Hong and Idan Shenfeld and Tsun-Hsuan Wang and Yung-Sung Chuang and Aldo Pareja and James Glass and Akash Srivastava and Pulkit Agrawal},
journal= {arXiv preprint arXiv:2402.19464},
year = {2024}
}
备注
Published at ICLR 2024