中文

ToxiLab: 开源大语言模型生成合成毒性数据的效果如何?

计算与语言 2025-02-25 v4 人工智能

摘要

有效的有害内容检测高度依赖高质量且多样化的数据,这些数据是稳健内容 moderation 模型的基础。合成数据已成为各种 NLP 任务训练模型的常见方法,但其在像仇恨言论检测这样高度主观的任务上效果仍不确定,此前的研究结果呈现出混合态。本研究探索了使用开源大语言模型进行有害数据合成的潜力,利用受控提示和监督式微调技术来提高数据质量和多样性。我们系统评估了 6 个开源大语言模型在 5 个数据集上的表现,评估它们生成多样化、高质量有害数据的能力,同时最小化幻觉和重复。我们的结果显示,Mistral 在其他开源模型中始终表现优异,监督式微调显著提高了数据可靠性和多样性。我们进一步分析了基于提示的有害数据合成与微调式有害数据合成之间的权衡,讨论了实际部署挑战,并强调了伦理考虑。我们的发现表明,经过微调的开源大语言模型提供了可扩展且成本效益高的解决方案,用于扩充有害内容检测的数据集,为更易于访问和透明的内容 moderation 工具铺平了道路。

关键词

引用

@article{arxiv.2411.15175,
  title  = {ToxiLab: How Well Do Open-Source LLMs Generate Synthetic Toxicity Data?},
  author = {Zheng Hui and Zhaoxiao Guo and Hang Zhao and Juanyong Duan and Lin Ai and Yinheng Li and Julia Hirschberg and Congrui Huang},
  journal= {arXiv preprint arXiv:2411.15175},
  year   = {2025}
}

备注

14 pages