Class-RAG:基于检索增强生成的实时内容审核
人工智能
2024-12-19 v2 计算与语言
摘要
鲁棒的内容审核分类器对于生成式人工智能系统的安全性至关重要。在此任务中,安全输入与不安全输入之间的差异通常极其细微,这使得分类器(甚至人类)在没有上下文或解释的情况下,难以正确区分违规样本与良性样本。通过持续的模型微调来扩展风险发现和缓解能力,过程缓慢、具有挑战性且成本高昂,阻碍了开发者快速有效地应对新出现的危害。我们提出了一种采用检索增强生成的分类方法(Class-RAG)。Class-RAG通过访问一个检索库来扩展其基础大语言模型的能力,该检索库可以动态更新,以实现语义热修复,从而进行即时、灵活的风险缓解。与模型微调相比,Class-RAG在决策中展现出灵活性和透明度,在分类任务上表现更优,并且对对抗性攻击更具鲁棒性,实证研究也证明了这一点。我们的研究结果还表明,Class-RAG的性能随检索库规模扩大而提升,这表明增加库规模是改善内容审核的一种可行且低成本的方法。
引用
@article{arxiv.2410.14881,
title = {Class-RAG: Real-Time Content Moderation with Retrieval Augmented Generation},
author = {Jianfa Chen and Emily Shen and Trupti Bavalatti and Xiaowen Lin and Yongkai Wang and Shuming Hu and Harihar Subramanyam and Ksheeraj Sai Vepuri and Ming Jiang and Ji Qi and Li Chen and Nan Jiang and Ankit Jain},
journal= {arXiv preprint arXiv:2410.14881},
year = {2024}
}
备注
11 pages, submit to ACL