RAVEN:基于强化推理的广告视频违规时间定位
计算与语言
2025-10-21 v1
摘要
广告(Ad)视频违规检测对于确保平台合规性至关重要,但现有方法在精确时间定位、噪声标注和有限泛化方面存在挑战。我们提出RAVEN,一种新型框架,集成了课程强化学习与多模态大语言模型(MLLMs),以增强推理和认知能力进行违规检测。RAVEN采用渐进式训练策略,结合精确和粗略标注数据,利用群体相对策略优化(GRPO)开发推理能力,而无需显式推理标注。多个分层精妙的奖励机制确保精确的时间定位和一致的类别预测。在工业数据集和公共基准测试中的实验表明,RAVEN在违规类别准确率和时间间隔定位方面实现卓越性能。我们还设计了将RAVEN部署在在线广告服务中的管道,线上A/B测试进一步验证了其实际适用性,在精确率和召回率方面实现显著提升。RAVEN还显示出强大的泛化能力,缓解了监督微调相关的灾难性遗忘问题。
引用
@article{arxiv.2510.16455,
title = {RAVEN: Robust Advertisement Video Violation Temporal Grounding via Reinforcement Reasoning},
author = {Deyi Ji and Yuekui Yang and Haiyang Wu and Shaoping Ma and Tianrun Chen and Lanyun Zhu},
journal= {arXiv preprint arXiv:2510.16455},
year = {2025}
}
备注
ACL 2025 (Oral, Industry Track)