ARGUS:基于演化强化学习与对抗裁判的政策自适应广告治理
计算与语言
2026-05-05 v1
摘要
在线广告治理面临由于监管政策的非平稳性带来的重大挑战,其中新兴的法规要求(如教育或审美焦虑的限制)在历史数据集中造成严重的标签不一致和推理模糊。在本文中,我们提出 ARGUS,一个政策自适应治理系统,通过多智能体对抗裁判实现演化式强化学习。ARGUS 通过三个阶段框架应对新政策数据的稀缺性:(1)政策初始化,用于初始感知;(2)对抗标签纠正,该框架采用“检方-防御-裁判”体系结构解决陈旧标签与新法规之间的冲突;(3)潜在知识发现,利用三方辩论论证挖掘高级的“灰色地带”违规。通过利用增强检索 (RAG) 的政策知识和链式思维合成作为动态奖励进行强化学习,ARGUS 将其推理路径与不断演化的法规同步。大量实验在工业和公共数据集上表明,ARGUS 显著优于传统微调基线,实现了具有最低金数据量的政策自适应学习。
引用
@article{arxiv.2605.02200,
title = {ARGUS: Policy-Adaptive Ad Governance via Evolving Reinforcement with Adversarial Umpiring},
author = {Deyi Ji and Junyu Lu and Xuanyi Liu and Liqun Liu and Hailong Zhang and Peng Shu and Huan Yu and Jie Jiang and Tianru Chen and Lanyun Zhu},
journal= {arXiv preprint arXiv:2605.02200},
year = {2026}
}
备注
ACL 2026 (Industry Track)