ChatGPT 中的毒性:基于人格分配的语言模型分析
计算与语言
2023-04-12 v1 人工智能
机器学习
摘要
大语言模型(LLMs)已展现出令人难以置信的能力,并超越了自然语言处理(NLP)社区,被应用于医疗、心理治疗、教育与客户服务等众多服务中。由于用户包括学生或与聊天机器人交互的患者等具有关键信息需求的人群,这些系统的安全性至关重要。因此,清晰理解 LLM 的能力与局限十分必要。为此,我们系统性地评估了热门的基于对话的 LLM——ChatGPT 在超过五十万次生成中的毒性。我们发现,通过为 ChatGPT 设置系统参数并赋予其人格(例如拳击手 Muhammad Ali),会显著增加生成内容的毒性。取决于赋予 ChatGPT 的人格,其毒性可增至最多 6 倍,输出涉及错误刻板印象、有害对话与伤人观点。这可能对人格方构成潜在诽谤,并对不知情用户造成伤害。此外,我们发现一些令人担忧的模式:无论赋予何种人格,特定实体(如某些种族)受到针对的程度高于其他实体(多 3 倍),反映出模型中固有的歧视性偏见。我们希望我们的发现能启发更广泛的 AI 社区重新思考当前安全护栏的有效性,并开发更好的技术以构建稳健、安全且可信的 AI 系统。
引用
@article{arxiv.2304.05335,
title = {Toxicity in ChatGPT: Analyzing Persona-assigned Language Models},
author = {Ameet Deshpande and Vishvak Murahari and Tanmay Rajpurohit and Ashwin Kalyan and Karthik Narasimhan},
journal= {arXiv preprint arXiv:2304.05335},
year = {2023}
}