中文

让我们用毒性文本的生成经验来取代这句话

计算与语言 2025-09-11 v1 人工智能

摘要

现代大型语言模型(LLMs)在生成合成数据方面表现卓越。然而,其在诸如文本去毒化等敏感领域的表现,尚未得到学术界的充分关注。本文探讨了使用LLM生成的合成有毒数据作为替代人工生成数据的可能性,以训练去毒化模型。我们使用 Llama 3 和 Qwen 激活补丁模型,为来自 ParaDetox 和 SST-2 数据集的中性文本生成合成有毒版本。我们的实验表明,基于合成数据微调的模型性能 consistently 低于基于人工数据的模型,综合指标性能下降最高可达 30%。我们识别出根本原因:LLM 生成有毒内容时使用的词汇量有限且重复,缺乏对人类毒性语言中细微差别和多样性的捕捉。这些发现凸显了当前LLM在该领域的局限性,强调了为构建健壮去毒化系统仍需多样化的人工标注数据。

关键词

引用

@article{arxiv.2509.08358,
  title  = {<think> So let's replace this phrase with insult... </think> Lessons learned from generation of toxic texts with LLMs},
  author = {Sergey Pletenev and Daniil Moskovskiy and Alexander Panchenko},
  journal= {arXiv preprint arXiv:2509.08358},
  year   = {2025}
}