大规模语言模型在滥用检测流水线中的应用
计算与语言
2026-04-02 v1 计算机与社会
摘要
在线滥用行为日益复杂,涵盖有毒语言、骚扰、操纵和欺诈行为。依赖静态分类器和劳动密集型标注的传统机器学习方法难以跟上不断演变的威胁模式和微妙的策略需求。大规模语言模型引入了上下文推理、策略解读、解释生成和跨模态理解等新能力,使其能够支持现代安全系统的多个阶段。本综述提供了对大规模语言模型如何集成到滥用检测生命周期(ADL)中的面向生命周期的分析,我们将 ADL 定义为四个阶段:(I)标注与特征生成,(II)检测,(III)审核与申诉,以及(IV)审计与治理。对于每个阶段,我们综合了新兴研究和行业实践,突出了生产部署的架构考量,并审视了大规模语言模型驱动方法的优势与局限。我们最后概述了关键挑战,包括延迟、成本效率、确定性、对抗鲁棒性和公平性,并讨论了将大规模语言模型操作化为大规模滥用检测与治理系统中可靠、可问责组件所需的研究方向。
引用
@article{arxiv.2604.00323,
title = {Large Language Models in the Abuse Detection Pipeline},
author = {Suraj Kath and Sanket Badhe and Preet Shah and Ashwin Sampathkumar and Shivani Gupta},
journal= {arXiv preprint arXiv:2604.00323},
year = {2026}
}