PolygloToxicityPrompts:大型语言模型中多语言有害 degeneration 的评估
计算与语言
2024-08-13 v3
摘要
近期大型语言模型(LLM)的快速发展导致其在全球范围内广泛部署,而确保其安全则需要全面且多语言的有害评估。然而,现有有害基准主要聚焦英文,可能在部署到其他语言时带来严重风险。为此我们引入PolygloToxicityPrompts(PTP),这是首个覆盖17种语言、包含42.5万自然发生提示的大规模多语言有害评估基准。我们通过自动抓取超过1亿网页文本,克服自然发生有害内容稀缺的局面,并确保不同语言资源下的覆盖。使用PTP,我们调查了模型规模、提示语言以及指令和偏好调优方法对有害性的影响,通过对60多款LLM进行基准测试。我们发现随着语言资源减少或模型规模增大,有害性也随之上升。尽管指令和偏好调优可降低有害性,但不同的偏好调优方法选择对其影响并无显著差异。我们的发现揭示了LLM防御措施的关键短板,并为未来研究指明了方向。
引用
@article{arxiv.2405.09373,
title = {PolygloToxicityPrompts: Multilingual Evaluation of Neural Toxic Degeneration in Large Language Models},
author = {Devansh Jain and Priyanshu Kumar and Samuel Gehman and Xuhui Zhou and Thomas Hartvigsen and Maarten Sap},
journal= {arXiv preprint arXiv:2405.09373},
year = {2024}
}
备注
Accepted to COLM 2024