基于结果奖励强化学习的生成式零样本学习方案
计算机视觉与模式识别
2026-03-24 v1
摘要
近期零样本学习(ZSL)的进展表明生成模型具有潜在潜力。通常情况下,生成式ZSL会对语义原型进行条件化以合成视觉特征,进而在合成数据上训练分类器。然而,合成特征往往是任务中性的,导致性能下降。此外,仅凭语义原型难以从分布中推断出可靠的表示,尤其是当类别在语义上相似但在视觉上差异显著时。为此,我们提出了RLVC——一种用于生成式零样本学习的基于结果奖励的强化学习框架。其核心理念是利用RL使生成模型自我演化,隐式提升其生成能力。具体而言,RLVC采用基于结果的奖励更新生成模型,以鼓励合成任务相关特征。进一步,我们引入类别级视觉线索,既实现合成特征与视觉原型的对齐,又稳定RL训练更新。对于训练过程,我们提出了一种新颖的冷启动策略。在三个常见ZSL基准上的全面实验与分析表明,RLVC以4.7%的提升实现了最先进的性能。
引用
@article{arxiv.2603.21138,
title = {Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues},
author = {Wenjin Hou and Xiaoxiao Sun and Hehe Fan},
journal= {arXiv preprint arXiv:2603.21138},
year = {2026}
}