中文

OneVision:面向多视角电商视觉搜索的端到端生成式框架

计算机视觉与模式识别 2026-01-09 v4

摘要

传统视觉搜索与搜索和推荐系统类似,采用多阶段级联架构(MCA)范式来平衡效率与转化率。具体而言,查询图像经过特征提取、召回、预排序和排序阶段,最终向用户呈现符合其偏好的语义相似产品。同一物体在查询中的多视角表示差异与这些阶段中的优化目标相互冲突,使得在用户体验和转化率之间难以达到帕累托最优。在本文中,提出了一种端到端生成式框架 OneVision 来解决这些问题。OneVision 基于 VRQ(视觉对齐残差量化编码),能够在对齐同一物体在不同视角下差异巨大的表示的同时,尽可能保留每个产品的独特特征。随后采用多阶段语义对齐方案,在保持强视觉相似性先验的同时,有效融入用户特定信息以实现个性化偏好生成。在离线评估中,OneVision 的性能与在线 MCA 持平,同时通过动态剪枝将推理效率提升了 21%。在 A/B 测试中,它取得了显著的线上提升:商品点击率 +2.15%,转化率 +2.27%,订单量 +3.12%。这些结果表明,以语义 ID 为中心的生成式架构可以在简化服务路径的同时统一检索与个性化。

关键词

引用

@article{arxiv.2510.05759,
  title  = {OneVision: An End-to-End Generative Framework for Multi-view E-commerce Vision Search},
  author = {Zexin Zheng and Huangyu Dai and Lingtao Mao and Xinyu Sun and Zihan Liang and Ben Chen and Yuqing Ding and Chenyi Lei and Wenwu Ou and Han Li and Kun Gai},
  journal= {arXiv preprint arXiv:2510.05759},
  year   = {2026}
}