UniRank:面向混合文本-图像候选对象的端到端领域特定重排序
量子代数
2026-04-01 v1
摘要
重排序是许多信息检索管道中的关键组件。尽管在文本-only 场景取得了显著进展,但多模态重排序仍然具有挑战,特别是当候选集合包含混合文本和图像项目时。一个关键难点是模态间隙:文本重排序器天然更接近文本候选对象,而不像图像候选对象,导致偏差和次优的跨模态排序。视觉-语言模型(VLM)通过强大的跨模态对齐来缩小这一间隙,并最近被用于构建多模态重排序器。然而,大多数基于 VLM 的重排序器将所有候选对象编码为图像,将文本作为图像处理会引入显著的计算开销。此外,现有的开源多模态重排序器通常在通用领域数据上训练,往往在领域特定场景下性能不佳。为解决这些限制,我们提出 UniRank,一个基于 VLM 的重排序框架,能够对混合文本-图像候选对象进行原生评分和排序,而无需任何模态转换。建立在这种混合评分接口之上,UniRank 提供了一个端到端的领域适应 pipeline,包括:(1) 一个指令调优阶段,通过将标签 token 概率映射到统一的标量评分来学习校准的跨模态相关性评分;以及 (2) 一个基于硬负例的偏好对齐阶段,该阶段构建领域内的成对偏好,并通过从人类反馈中进行强化学习(RLHF) 执行查询级别的策略优化。针对科学文献检索和设计专利检索进行的大规模实验表明,UniRank 在所有基准上都一致地优于最先进的基线,分别将 Recall@1 提升 8.9% 和 7.3%。
引用
@article{arxiv.2603.29896,
title = {Qudit stabilizers beyond the free case and the twisted Kitaev model},
author = {Ruslan Maksimau},
journal= {arXiv preprint arXiv:2603.29896},
year = {2026}
}
备注
29 pages