中文

BLM-Guard:基于链路思考与政策对齐奖励的可解释多模态广告内容审核

计算机视觉与模式识别 2026-02-24 v2

摘要

短视频平台现已 hosting 大量多模态广告,其误导性视觉、语音和字幕需求超过社区安全过滤器的细粒度、政策驱动的审核能力。我们提出 BLM-Guard,一个针对商业广告的内容审核框架,将链路思考推理与规则导向的政策原则相结合,并融合批判性引导的奖励。规则驱动的 ICoT 数据合成管道通过生成结构化场景描述、推理链和标签来启动训练,显著降低标注成本。强化学习随后利用平衡因果连贯性与政策遵循性的复合奖励来细化模型。多任务架构模型处理 intra-modal 操作(如夸大图像)和 cross-modal 不匹配(如字幕语音偏移),提升鲁棒性。实验在真实短视频广告上表明,BLM-Guard 在准确性、一致性和泛化能力方面均优于强大的基线方法。

关键词

引用

@article{arxiv.2602.18193,
  title  = {BLM-Guard: Explainable Multimodal Ad Moderation with Chain-of-Thought and Policy-Aligned Rewards},
  author = {Yiran Yang and Zhaowei Liu and Yuan Yuan and Yukun Song and Xiong Ma and Yinghao Song and Xiangji Zeng and Lu Sun and Yulu Wang and Hai Zhou and Shuai Cui and Zhaohan Gong and Jiefei Zhang},
  journal= {arXiv preprint arXiv:2602.18193},
  year   = {2026}
}

备注

7 pages, 3 figures. To appear in AAAI 2026