中文

文本去毒化:数据效率、语义保留与模型泛化

机器学习 2025-07-08 v2 人工智能 计算与语言

摘要

社交媒体上有毒内容的广泛传播对在线环境和公共话语构成严重威胁,凸显了亟需有效去毒化方法以移除有害内容同时保留原始语义的需求。然而,现有方法往往难以同时实现强大的去毒化性能、语义保留以及对分布外数据的鲁棒性。此外,这些方法通常依赖高成本的手动标注平行语料,且数据效率较差。为此,我们提出一种两阶段训练框架,联合优化数据效率、语义保留与模型泛化。首先,在小规模高质量过滤后的平行数据上进行监督微调,以获得强大的初始化。随后,利用无标签有毒输入和自定义奖励模型,通过群相对政策优化(Group Relative Policy Optimization)对 LLM 进行训练。实验结果表明,我们的方法有效缓解了前人工作所面临的权衡问题,以实现数据效率显著提升和更好的泛化性能,同时实现了状态机械水平。我们的代码已公开:https://github.com/allacnobug/Detoxification-of-Text。

关键词

引用

@article{arxiv.2507.01050,
  title  = {Text Detoxification: Data Efficiency, Semantic Preservation and Model Generalization},
  author = {Jing Yu and Yibo Zhao and Jiapeng Zhu and Wenming Shao and Bo Pang and Zhao Zhang and Xiang Li},
  journal= {arXiv preprint arXiv:2507.01050},
  year   = {2025}
}