中文

UniRank:混合文本-图像候选的端到端领域特定重排序

信息检索 2026-05-26 v2 人工智能

摘要

重排序是许多信息检索流程中的关键组成部分。尽管在纯文本设置中取得了显著进展,多模态重排序仍然具有挑战性,尤其是当候选集包含混合的文本和图像项目时。一个关键的难点是模态差距:文本重排序器本质上更接近文本候选而非图像候选,导致有偏且次优的跨模态排序。视觉语言模型(VLM)通过强大的跨模态对齐缓解了这一差距,并且最近已被用于构建多模态重排序器。然而,大多数基于 VLM 的重排序器将所有候选编码为图像,而将文本视为图像会引入大量的计算开销。同时,现有的开源多模态重排序器通常在通用领域数据上训练,在特定领域场景中往往表现不佳。为解决这些限制,我们提出了 UniRank,一个基于 VLM 的重排序框架,无需任何模态转换即可原生地对混合文本-图像候选进行评分和排序。在此混合评分接口的基础上,UniRank 提供了一个端到端的领域自适应流程,包括:(1)指令微调阶段,通过将标签令牌似然映射到统一的标量分数来学习校准的跨模态相关性评分;(2)由难负样本驱动的偏好对齐阶段,构建领域内的成对偏好,并通过基于人类反馈的强化学习(RLHF)执行查询级策略优化。在科学文献检索和外观设计专利搜索上的大量实验表明,UniRank 持续优于最先进的基线,Recall@1 分别提高了 8.9% 和 7.3%。

关键词

引用

@article{arxiv.2603.29897,
  title  = {UniRank: End-to-End Domain-Specific Reranking of Hybrid Text-Image Candidates},
  author = {Yupei Yang and Lin Yang and Wanxi Deng and Lin Qu and Shikui Tu and Lei Xu},
  journal= {arXiv preprint arXiv:2603.29897},
  year   = {2026}
}