中文

GRPO-TTA:基于 GRPO 驱动的视觉语言模型测试时视觉调优

计算机视觉与模式识别 2026-05-06 v1 机器学习

摘要

组相对策略优化 (GRPO) 近期在大型语言模型和视觉语言模型的后训练中展现出强大的性能。这引发了一个问题:GRPO 是否也显著推动了视觉语言模型的测试时适应 (TTA)。本文提出了用于测试时适应的组相对策略优化 (GRPO-TTA),通过重新构建类别特定提示预测作为组间策略优化问题来将 GRPO 应用于 TTA 设置。具体而言,我们通过对 CLIP 相似度分布进行采样来构建输出组,从而在无需访问真实标签的情况下进行概率驱动的优化。此外,我们设计了针对测试时适应的奖励函数,包括对齐奖励和离散奖励,以引导有效的视觉编码器调优。广泛的实验在多样化基准上表明,GRPO-TTA 在测试时适应方法中 consistently 优于现有方法,在自然分布偏移情况下的性能提升尤为显著。

关键词

引用

@article{arxiv.2605.03403,
  title  = {GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning},
  author = {Yujun Li and Hongyuan Zhang and Yuan Yuan},
  journal= {arXiv preprint arXiv:2605.03403},
  year   = {2026}
}