中文

时空图引导的多模态网络用于直播商品检索

计算机视觉与模式识别 2024-08-06 v3 多媒体

摘要

随着电子商务的快速发展,越来越多的消费者倾向于通过直播购物。准确识别销售人员正在销售的商品,即直播商品检索(LPR),是一项基础且具有挑战性的任务。LPR 任务在现实场景中面临三个主要难题:(1) 从背景中的干扰商品中识别出目标商品;(2) 视频与图像之间的异质性,即直播中展示的商品外观通常与商店中的标准商品图像存在显著差异;(3) 商店中存在大量外观细微差别的混淆商品。为了解决这些挑战,我们提出了时空图多模态网络(SGMN)。首先,我们采用文本引导的注意力机制,利用销售人员的口头描述来引导模型关注目标商品,强调其在杂乱背景中的显著性。其次,设计了一个长程时空图网络,以实现实例级交互和帧级匹配,解决由视频-图像异质性引起的错位问题。第三,我们提出了一种多模态难例挖掘方法,帮助模型在视频-图像-文本域中区分具有细粒度特征的高度相似商品。通过大量的定量和定性实验,我们证明了所提出的 SGMN 模型的优越性能,显著超越了现有最先进的方法。代码可在 https://github.com/Huxiaowan/SGMN 获取。

关键词

引用

@article{arxiv.2407.16248,
  title  = {Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval},
  author = {Xiaowan Hu and Yiyi Chen and Yan Li and Minquan Wang and Haoqian Wang and Quan Chen and Han Li and Peng Jiang},
  journal= {arXiv preprint arXiv:2407.16248},
  year   = {2024}
}

备注

16 pages, 12 figures