中文

导师-学生强化学习:用于鲁棒深度伪造检测的动态课程

计算机视觉与模式识别 2026-05-21 v2 机器学习

摘要

标准的监督训练在深度伪造检测中将所有样本视为uniform重要性,这在学习鲁棒且可泛化特征方面可能并非最优。本文提出一种新颖的导师-学生强化学习(Tutor-Student Reinforcement Learning, TSRL)框架,以动态优化训练课程。我们将训练过程建模为马尔可夫决策过程,其中“导师”智能体学习指导“学生”(深度伪造检测器)。导师通过使用近端策略优化(Proximal Policy Optimization, PPO)实现,观察每个训练样本的丰富状态表示,这不仅包含其视觉特征,还包括其历史学习动力学,如指数移动平均损失和遗忘计数。基于该状态,导师通过为样本损失分配一个连续权重(0-1),从而动态重新加权训练批次中的样本。导师根据学生的即时性能变化给予奖励,具体而言,是奖励从错误预测到正确预测的转换。这种策略鼓励导师学习一种优先考虑高价值样本(如易学但困难的示例)的课程,从而实现更高效和更有效的训练过程。我们展示了这种自适应课程在针对未见的操纵技术提高学生的泛化能力方面优于传统训练方法。代码可在 https://github.com/wannac1/TSRL 获取。

关键词

引用

@article{arxiv.2603.24139,
  title  = {Tutor-Student Reinforcement Learning: A Dynamic Curriculum for Robust Deepfake Detection},
  author = {Zhanhe Lei and Zhongyuan Wang and Jikang Cheng and Baojin Huang and Yuhong Yang and Zhen Han and Chao Liang and Dengpan Ye},
  journal= {arXiv preprint arXiv:2603.24139},
  year   = {2026}
}

备注

Accepted to CVPR 2026