时尚聚焦:面向电商视频商品定位的多模态检索系统
计算机视觉与模式识别
2021-02-10 v1
摘要
如今,电商中的直播与短视频购物呈指数级增长。然而,卖家需手动将售卖商品图像与未剪辑视频中的展示时间戳匹配,流程繁琐。为解决该问题,我们提出了一种名为“时尚聚焦(Fashion Focus)”的创新多模态检索系统演示,其能够精确地将在线视频中的商品图像定位为焦点。不同模态有助于联合定位,包括视觉内容、语言特征与交互上下文均通过所提多模态学习进行联合研究。我们的系统采用视频内容结构化与多模态检索两步分析流程,自动实现准确的视频到商品匹配。时尚聚焦提供了一个统一框架,可在观看视频时将消费者导向相关商品展示,并帮助卖家通过搜索与推荐有效交付商品。
引用
@article{arxiv.2102.04727,
title = {Fashion Focus: Multi-modal Retrieval System for Video Commodity Localization in E-commerce},
author = {Yanhao Zhang and Qiang Wang and Pan Pan and Yun Zheng and Cheng Da and Siyang Sun and Yinghui Xu},
journal= {arXiv preprint arXiv:2102.04727},
year = {2021}
}
备注
accepted by AAAI 2021