R^3:基于群体相对经验提取器和课程强化学习的广告合规整改
计算与语言
2026-07-08 v1 机器学习
摘要
严格的内容审核对于在线广告至关重要,但会导致每天数百万次的拒绝。这种规模使得手动整改不可行,尤其是对于视频广告。然而,现有的安全驱动方法常常遭受激进过度编辑的困扰,这仅仅为了满足合规性而损害了广告商的原始语义意图。在这项工作中,我们针对视频广告中的文本违规整改,涵盖语音转录和屏幕文本。我们提出了R^3,一个旨在协调合规性与原始语义意图保留的新颖框架。我们的方法整合了三个关键创新:(1)一个经验驱动的数据合成框架,通过群体相对合规经验提取器引导高质量监督;(2)一个具有分层奖励的课程强化学习策略,旨在强制合规同时最大化语义一致性;(3)一个全面的视频整改框架,无缝集成文本识别、重写和重新渲染,用于工业部署。在工业数据集和在线A/B测试上的大量实验表明,R^3显著优于最先进的基线,在违规整改和意图保留之间实现了最佳权衡。
引用
@article{arxiv.2607.07318,
title = {R^3: Advertisement Compliance Rectification via Group-Relative Experience Extractor and Curriculum Reinforcement},
author = {Yuan Chen and Zhenyu Hu and Mengge Xue and Te Cao and Liqun Liu and Peng Shu and Huan Yu and Jie Jiang},
journal= {arXiv preprint arXiv:2607.07318},
year = {2026}
}
备注
ACL 2026 (Poster, Industry Track)