中文

ToxiCraft:合成有害信息的新型框架

计算与语言 2025-04-16 v2 人工智能

摘要

在不同的 NLP 任务中,检测有害内容对于线上环境至关重要,尤其是随着社交媒体影响力的增长。然而,先前的研究存在两个主要问题:1)在低资源环境中缺乏数据,2)对有害内容的定义和判定标准不一致,需要分类模型对鲁棒性强、适应性好的。我们提出 Toxicraft,一个用于合成有害信息数据集的新型框架,以解决上述弱点。仅凭少量种子数据,我们的框架即可生成多样化的、却异常逼真的有害信息示例。跨各种数据集的实验表明,该框架显著提升了检测模型的鲁棒性和适应性,超越或接近金标标签。

关键词

引用

@article{arxiv.2409.14740,
  title  = {ToxiCraft: A Novel Framework for Synthetic Generation of Harmful Information},
  author = {Zheng Hui and Zhaoxiao Guo and Hang Zhao and Juanyong Duan and Congrui Huang},
  journal= {arXiv preprint arXiv:2409.14740},
  year   = {2025}
}

备注

EMNLP 2024