中文

通过越狱对 ChatGPT 进行红队测试:偏见、鲁棒性、可靠性与毒性

计算与语言 2023-05-30 v4 软件工程

摘要

自然语言处理(NLP)近期的突破使得以开放式方式合成与理解连贯文本成为可能,从而将理论算法转化为实际应用。大语言模型(LLMs)已对报告摘要软件和文案撰写等业务产生了显著影响。然而,观察表明,LLMs 可能表现出社会偏见与毒性,因不负责任使用而带来伦理与社会危害风险。因此,应当开发面向负责任 LLMs 的大规模评测基准。尽管若干实证研究揭示了先进 LLMs 中存在少数伦理难题,但对于当前 LLM 使用风险与有害行为的系统性检验和用户研究仍十分匮乏。为给未来负责任地构建伦理 LLMs 的工作提供借鉴,我们对 OpenAI 的 ChatGPT\footnote{本文中 ChatGPT 指 12 月 15 日发布的版本。}采用了一种称为“红队测试”的定性研究方法,以更好地理解近期 LLMs 中伦理危害的实际特征。我们从四个角度对 ChatGPT 进行了全面分析:1) \textit{偏见} 2) \textit{可靠性} 3) \textit{鲁棒性} 4) \textit{毒性}。依据所述视角,我们在多个样本数据集上对 ChatGPT 进行了实证评测。我们发现大量伦理风险无法被现有基准覆盖,因此通过额外案例研究加以说明。此外,我们探讨了研究发现对 AI 伦理及 ChatGPT 有害行为的启示,以及负责任 LLMs 的未来问题与实用设计考量。我们相信,我们的发现可为未来识别并缓解 LLM 应用中机器所带来的伦理危害的工作提供启示。

关键词

引用

@article{arxiv.2301.12867,
  title  = {Red teaming ChatGPT via Jailbreaking: Bias, Robustness, Reliability and Toxicity},
  author = {Terry Yue Zhuo and Yujin Huang and Chunyang Chen and Zhenchang Xing},
  journal= {arXiv preprint arXiv:2301.12867},
  year   = {2023}
}

备注

Technical Report