中文

GRAPE:让 GRPO 监督基于排序的查询重写以提高检索效果

计算机视觉与模式识别 2026-05-11 v2

摘要

CLIP 模型已成为大规模检索系统的基石,但其性能在分布迁移(如多语言、长文本或多模态查询)下常常下降。为避免检索器重新训练或语料重新嵌入的高昂成本,我们提出 GRAPE(Grouped Ranking-Aware Policy Optimization Enhancement),一种即插即用的方法,利用基于 LLM 的查询重写来弥合这些差距。不同于已有方法缺乏显式监督,GRAPE 将排序信号整合到重写 LLM 中,通过分组相对策略优化(GRPO)确保重写后的查询更好地与冻结检索器的潜在分布对齐。关键的是,我们识别到了基于相似度的微调中出现的得分膨胀现象——即无关候选者获得不成比例的高分——并通过一种新颖的语料相对排序-based reward 来缓解。广泛的实验在多语言(Flickr30k-CN、CVLTE、XM3600)、长文本(Wikipedia)和多模态(CIRR)基准测试中表明,GRAPE 一致地改善了性能,在不修改底层检索器的前提下实现了 Recall@10 平均提升 4.9%。代码已公开 https://github.com/mogulzhang/GRAPE。

关键词

引用

@article{arxiv.2509.23370,
  title  = {GRAPE: Let GRPO Supervise Query Rewriting by Ranking for Retrieval},
  author = {Zhaohua Zhang and Jianhuan Zhuo and Muxi Chen and Chenchen Zhao and Wenyu Jiang and Tianwen Jiang and Mingyang Chen and Yutang and Qiuyong Xiao and Jihong Zhang and Zhixun Su},
  journal= {arXiv preprint arXiv:2509.23370},
  year   = {2026}
}