中文

UniNote:一种用于多模态表示和排序的统一嵌入模型

信息检索 2026-05-29 v1

摘要

项目到项目 (Item-to-Item, I2I) 检索是现代内容平台的基本组成部分,支持从推荐引擎到内容审核等关键的工业工作流程。虽然多模态嵌入方法在一般检索方面取得了进展,但它们往往在 I2I 场景中表现不佳,原因在于在平衡全局内容表示与细粒度局部检索、解耦嵌入-排序管道的系统效率以及模型精度与服务延迟之间的固有权衡方面存在挑战。为解决这些问题,我们提出了 UniNote,一个为工业 I2I 检索设计的统一嵌入模型。针对不同粒度的复杂多模态内容,引入了针对性检索策略以支持表示学习。为实现这些策略,UniNote 采用两阶段训练范式:第一阶段利用对比式 SFT 建立稳健的基础嵌入,第二阶段通过强化学习 (RL) 过程细化排序质量,以与内容相关性保持一致。我们的结果表明,UniNote 在 diverse I2I 任务上实现了 SOTA 性能。在小红书部署并集成 Matryoshka 表示学习 (MRL) 后,UniNote 在大规模应用中实现了检索质量和成本效率的显著提升。

关键词

引用

@article{arxiv.2605.29286,
  title  = {CrossAlpha: An Annual-Report Benchmark for Cross-Market Factor Research},
  author = {Qian Wang and Zhongyi Tong and Nuo Chen and Zhaomin Wu and Bingsheng He},
  journal= {arXiv preprint arXiv:2605.29286},
  year   = {2026}
}