中文

面向可信多模态内容审核:基于政策对齐推理与分层标签

计算与语言 2026-01-09 v2 机器学习

摘要

社交平台的兴起加速了有害内容和违规内容的传播。为在大规模场景下确保安全与合规,内容审核系统不仅要高效,还需具备准确性和可解释性。然而,现有方法大多依赖噪声较大的标签驱动学习,缺乏与审核规则的对齐,并产生难以解释的决策,致使人工审核受阻。为此,我们提出了分层守卫框架(Hierarchical Guard, Hi-Guard),一种引入新型政策对齐决策范式的多模态内容审核方法。术语“分层”体现在系统设计的两个关键方面:(1)分层审核流程,其中轻量级二分类模型首先筛选安全内容,强力模型负责细粒度风险分类;(2)第二阶段的分层分类学,其中模型在从粗到细的层级范围内进行基于路径的分类。为确保与演进中的审核政策对齐,Hi-Guard直接将规则定义纳入模型提示中。为进一步增强结构化预测与推理,我们引入多级软边际奖励,并通过群相对政策优化(Group Relative Policy Optimization, GRPO)进行优化,对语义相邻的误分类进行惩罚,提升解释质量。大量实验和实际部署结果表明,Hi-Guard 在分类准确率、泛化能力和可解释性方面均显著优于现有方法,为构建可扩展、透明且可信的内容安全系统 paving the way 了新的可能。代码已公开:https://github.com/lianqi1008/Hi-Guard

关键词

引用

@article{arxiv.2508.03296,
  title  = {Towards Trustworthy Multimodal Moderation via Policy-Aligned Reasoning and Hierarchical Labeling},
  author = {Anqi Li and Wenwei Jin and Jintao Tong and Pengda Qin and Weijia Li and Guo Lu},
  journal= {arXiv preprint arXiv:2508.03296},
  year   = {2026}
}

备注

Accepted by KDD 2026. Code is available at https://github.com/lianqi1008/Hi-Guard