RTP-LX:大型语言模型能否评估多语言场景中的毒性?
计算与语言
2025-05-05 v2 计算机与社会
机器学习
摘要
大型语言模型(LLM)和小型语言模型(SLM)正以惊人的速度被采用,尽管其安全性仍然是一个严重问题。随着多语言S/LLM的出现,问题现在变成了规模问题:我们能否以与部署速度相同的速度扩展这些模型的多语言安全评估?为此,我们引入了RTP-LX,这是一个人工转创和人工标注的语料库,包含28种语言的有毒提示和输出。RTP-LX遵循参与式设计实践,其中一部分语料库专门设计用于检测文化特异性有毒语言。我们评估了10个S/LLM在文化敏感的多语言场景中检测有毒内容的能力。我们发现,尽管它们在准确率方面通常得分可接受,但在整体评估提示毒性时与人类评判者的一致性较低;并且在依赖上下文的场景中难以辨别伤害,特别是对于微妙但有害的内容(例如微攻击、偏见)。我们发布该数据集以进一步减少这些模型的有害使用并改善其安全部署。
引用
@article{arxiv.2404.14397,
title = {RTP-LX: Can LLMs Evaluate Toxicity in Multilingual Scenarios?},
author = {Adrian de Wynter and Ishaan Watts and Tua Wongsangaroonsri and Minghui Zhang and Noura Farra and Nektar Ege Altıntoprak and Lena Baur and Samantha Claudet and Pavel Gajdusek and Can Gören and Qilong Gu and Anna Kaminska and Tomasz Kaminski and Ruby Kuo and Akiko Kyuba and Jongho Lee and Kartik Mathur and Petter Merok and Ivana Milovanović and Nani Paananen and Vesa-Matti Paananen and Anna Pavlenko and Bruno Pereira Vidal and Luciano Strika and Yueh Tsao and Davide Turcato and Oleksandr Vakhno and Judit Velcsov and Anna Vickers and Stéphanie Visser and Herdyan Widarmanto and Andrey Zaikin and Si-Qing Chen},
journal= {arXiv preprint arXiv:2404.14397},
year = {2025}
}
备注
AAAI 2025--camera ready + extended abstract