中文

基于结果奖励强化学习的生成式零样本学习方案

计算机视觉与模式识别 2026-03-24 v1

摘要

近期零样本学习(ZSL)的进展表明生成模型具有潜在潜力。通常情况下,生成式ZSL会对语义原型进行条件化以合成视觉特征,进而在合成数据上训练分类器。然而,合成特征往往是任务中性的,导致性能下降。此外,仅凭语义原型难以从分布中推断出可靠的表示,尤其是当类别在语义上相似但在视觉上差异显著时。为此,我们提出了RLVC——一种用于生成式零样本学习的基于结果奖励的强化学习框架。其核心理念是利用RL使生成模型自我演化,隐式提升其生成能力。具体而言,RLVC采用基于结果的奖励更新生成模型,以鼓励合成任务相关特征。进一步,我们引入类别级视觉线索,既实现合成特征与视觉原型的对齐,又稳定RL训练更新。对于训练过程,我们提出了一种新颖的冷启动策略。在三个常见ZSL基准上的全面实验与分析表明,RLVC以4.7%的提升实现了最先进的性能。

关键词

引用

@article{arxiv.2603.21138,
  title  = {Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues},
  author = {Wenjin Hou and Xiaoxiao Sun and Hehe Fan},
  journal= {arXiv preprint arXiv:2603.21138},
  year   = {2026}
}