FlexGuard:严格性自适应 LLM 内容审核的连续风险评分
机器学习
2026-04-16 v3 人工智能
摘要
确保 LLM 生成内容的安全是实际部署的关键。大多数现有警戒模型将审核建模为固定的二元分类任务,隐含地假设有固定的有害性定义。实际情况下,执行严格性 — — 即如何保守地定义和执行有害性 — — 因平台而异且随时间变化,使得二元审核器在需求变化时变得脆弱。我们首先引入 FlexBench,一个严格性自适应的 LLM 审核基准,支持在多个严格性方案下进行受控评估。FlexBench 上的实验揭示了现有审核器在跨严格性下的显著不一致性:在一个方案下表现良好的模型可能在其他方案下性能显著下降,限制了其实际可用性。为此,我们提出 FlexGuard,一种基于 LLM 的审核系统,输出已校准的连续风险评分,反映风险严重程度,并通过阈值化决策支持严格性特定的决策。我们通过风险对齐优化训练 FlexGuard 以提高得分-严重程度一致性,并提供实用的阈值选择策略以适应部署时的目标严格性。FlexBench 和公开基准上的实验表明,FlexGuard 在内容审核准确率和在不同严格性下的鲁棒性方面均取得更好的表现。我们发布了源代码和数据以支持可重复性。
引用
@article{arxiv.2602.23636,
title = {FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation},
author = {Zhihao Ding and Jinming Li and Ze Lu and Jieming Shi},
journal= {arXiv preprint arXiv:2602.23636},
year = {2026}
}
备注
Accepted at ACL 2026