中文

UniRank:面向混合文本-图像候选对象的端到端领域特定重排序

量子代数 2026-04-01 v1

摘要

重排序是许多信息检索管道中的关键组件。尽管在文本-only 场景取得了显著进展,但多模态重排序仍然具有挑战,特别是当候选集合包含混合文本和图像项目时。一个关键难点是模态间隙:文本重排序器天然更接近文本候选对象,而不像图像候选对象,导致偏差和次优的跨模态排序。视觉-语言模型(VLM)通过强大的跨模态对齐来缩小这一间隙,并最近被用于构建多模态重排序器。然而,大多数基于 VLM 的重排序器将所有候选对象编码为图像,将文本作为图像处理会引入显著的计算开销。此外,现有的开源多模态重排序器通常在通用领域数据上训练,往往在领域特定场景下性能不佳。为解决这些限制,我们提出 UniRank,一个基于 VLM 的重排序框架,能够对混合文本-图像候选对象进行原生评分和排序,而无需任何模态转换。建立在这种混合评分接口之上,UniRank 提供了一个端到端的领域适应 pipeline,包括:(1) 一个指令调优阶段,通过将标签 token 概率映射到统一的标量评分来学习校准的跨模态相关性评分;以及 (2) 一个基于硬负例的偏好对齐阶段,该阶段构建领域内的成对偏好,并通过从人类反馈中进行强化学习(RLHF) 执行查询级别的策略优化。针对科学文献检索和设计专利检索进行的大规模实验表明,UniRank 在所有基准上都一致地优于最先进的基线,分别将 Recall@1 提升 8.9% 和 7.3%。

关键词

引用

@article{arxiv.2603.29896,
  title  = {Qudit stabilizers beyond the free case and the twisted Kitaev model},
  author = {Ruslan Maksimau},
  journal= {arXiv preprint arXiv:2603.29896},
  year   = {2026}
}

备注

29 pages