ToxiCraft:合成有害信息的新型框架
计算与语言
2025-04-16 v2 人工智能
摘要
在不同的 NLP 任务中,检测有害内容对于线上环境至关重要,尤其是随着社交媒体影响力的增长。然而,先前的研究存在两个主要问题:1)在低资源环境中缺乏数据,2)对有害内容的定义和判定标准不一致,需要分类模型对鲁棒性强、适应性好的。我们提出 Toxicraft,一个用于合成有害信息数据集的新型框架,以解决上述弱点。仅凭少量种子数据,我们的框架即可生成多样化的、却异常逼真的有害信息示例。跨各种数据集的实验表明,该框架显著提升了检测模型的鲁棒性和适应性,超越或接近金标标签。
引用
@article{arxiv.2409.14740,
title = {ToxiCraft: A Novel Framework for Synthetic Generation of Harmful Information},
author = {Zheng Hui and Zhaoxiao Guo and Hang Zhao and Juanyong Duan and Congrui Huang},
journal= {arXiv preprint arXiv:2409.14740},
year = {2025}
}
备注
EMNLP 2024