中文

面向电商的多模态多视图因子化运输对齐

社会与信息网络 2025-12-23 v1

摘要

电商的快速增长需要能够捕获用户生成列表中多样化信号的鲁健多模态表征。现有的视觉语言模型(VLM)通常将标题与主图像对齐,即单视图,但忽略非主图像和辅助文本视图,这些在像Etsy或Poshmark这样的开放型市场中提供关键语义。为此,我们提出了通过因子化运输(Factorized Transport)实现的框架,将多模态和多视图学习统一起来。该方法是最优运输的轻量级近似,旨在实现可扩展性和部署效率。在训练期间,该方法强调主视图并随机抽取辅助视图,降低了从视图数量的二次方降低到每个物品常数的训练成本。在推断时,所有视图被融合到单个缓存嵌入中,保留了两塔检索的效率,无需额外的在线开销。在包含100万个产品列表和30万次交互的工业数据集上,我们的方法在跨视图和查询到物品检索方面实现了持续的改进,使召回率(Recall@500)提升最高可达7.9%。总体而言,我们的框架在可扩展性与基于最优运输的学习之间架起了桥梁,使大规模电商搜索的多视图预训练变得实用。

关键词

引用

@article{arxiv.2512.18116,
  title  = {Network Analysis of Cyberbullying Interactions on Instagram},
  author = {Satyaki Sikdar and Manuel Sandoval and Taylor Hales and Chloe Kilroy and Maddie Juarez and Tyler Rosario and Juan J. Rosendo and Deborah L. Hall and Yasin N. Silva},
  journal= {arXiv preprint arXiv:2512.18116},
  year   = {2025}
}

备注

11 pages, 6 figures, 3 tables