FrenchToxicityPrompts:用于评估和缓解法语文本有害性的大型基准数据集
计算与语言
2024-06-26 v1
摘要
大型语言模型(LLM)日益受到欢迎,但也容易生成偏见、有毒或有害的语言,这可能对个人和社区造成不利影响。虽然大多数努力都集中在评估和缓解生成内容中的有毒性,但主要针对英语,而且考虑其他语言的重要性不为人知。为此,我们创建并发布了FrenchToxicityPrompts,这是一个包含5万个自然发生的法语提示及其续写的数据集,标注了来自广泛使用的有毒性分类器的有毒性评分。我们对14个来自四个主流开源LLM家族的模型进行评估,以评估其在各种维度上的潜在有毒性。我们希望我们的贡献能促进未来在英语之外的语言上进行有毒性检测和缓解研究。
引用
@article{arxiv.2406.17566,
title = {FrenchToxicityPrompts: a Large Benchmark for Evaluating and Mitigating Toxicity in French Texts},
author = {Caroline Brun and Vassilina Nikoulina},
journal= {arXiv preprint arXiv:2406.17566},
year = {2024}
}
备注
TRAC-2024, Fourth Workshop on Threat, Aggression and Cyberbullying. 20 May 2024