ChatGPT中毒性内容的综合评估
计算机与社会
2023-11-28 v1 计算与语言
密码学与安全
机器学习
摘要
审核攻击性、仇恨性与毒性语言一直是NLP安全使用领域重要却具挑战的课题。新兴的大语言模型(LLMs),如ChatGPT,可能进一步放大此威胁。已有研究指出ChatGPT可利用精心构造的输入生成毒性回复。然而,系统性考察ChatGPT何时生成毒性回复的研究有限。本文利用贴近真实场景的指令微调数据集,全面评估ChatGPT中的毒性。结果显示,ChatGPT的毒性随提示的不同属性与设置(包括任务、领域、长度与语言)而变化。值得注意的是,创意写作任务的提示引发毒性回复的可能性可达其他任务的2倍。以德语与葡萄牙语提示亦可使回复毒性翻倍。此外,我们发现早期研究设计的某些蓄意毒性提示不再产生有害回复。希望我们的发现能引导模型开发者更好地规范这些AI系统,并帮助用户避免不期望的输出。
引用
@article{arxiv.2311.14685,
title = {Comprehensive Assessment of Toxicity in ChatGPT},
author = {Boyang Zhang and Xinyue Shen and Wai Man Si and Zeyang Sha and Zeyuan Chen and Ahmed Salem and Yun Shen and Michael Backes and Yang Zhang},
journal= {arXiv preprint arXiv:2311.14685},
year = {2023}
}