中文

时尚聚焦:面向电商视频商品定位的多模态检索系统

计算机视觉与模式识别 2021-02-10 v1

摘要

如今,电商中的直播与短视频购物呈指数级增长。然而,卖家需手动将售卖商品图像与未剪辑视频中的展示时间戳匹配,流程繁琐。为解决该问题,我们提出了一种名为“时尚聚焦(Fashion Focus)”的创新多模态检索系统演示,其能够精确地将在线视频中的商品图像定位为焦点。不同模态有助于联合定位,包括视觉内容、语言特征与交互上下文均通过所提多模态学习进行联合研究。我们的系统采用视频内容结构化与多模态检索两步分析流程,自动实现准确的视频到商品匹配。时尚聚焦提供了一个统一框架,可在观看视频时将消费者导向相关商品展示,并帮助卖家通过搜索与推荐有效交付商品。

关键词

引用

@article{arxiv.2102.04727,
  title  = {Fashion Focus: Multi-modal Retrieval System for Video Commodity Localization in E-commerce},
  author = {Yanhao Zhang and Qiang Wang and Pan Pan and Yun Zheng and Cheng Da and Siyang Sun and Yinghui Xu},
  journal= {arXiv preprint arXiv:2102.04727},
  year   = {2021}
}

备注

accepted by AAAI 2021