面向现实世界不良内容检测的整体方法
计算与语言
2023-02-16 v2 机器学习
摘要
我们提出一种整体方法来构建用于现实世界内容审核的鲁棒且实用的自然语言分类系统。此类系统的成功依赖于一系列精心设计和执行步骤的链条,包括内容分类体系和标注指令的设计、数据质量控制、用于捕获罕见事件的主动学习流程,以及多种使模型鲁棒并避免过拟合的方法。我们的审核系统经训练可检测广泛的不良内容类别,包括性内容、仇恨内容、暴力、自残和骚扰。该方法可推广至多种不同的内容分类体系,并可用于创建优于开箱即用模型的高质量内容分类器。
引用
@article{arxiv.2208.03274,
title = {A Holistic Approach to Undesired Content Detection in the Real World},
author = {Todor Markov and Chong Zhang and Sandhini Agarwal and Tyna Eloundou and Teddy Lee and Steven Adler and Angela Jiang and Lilian Weng},
journal= {arXiv preprint arXiv:2208.03274},
year = {2023}
}
备注
Oral presentation at AAAI-23