面向直播商品识别的跨视图语义对齐
计算机视觉与模式识别
2023-08-22 v2
摘要
直播电商是通过直播在线销售商品的行为。客户对在线商品的多样化需求给直播商品识别带来了更多挑战。先前工作主要关注时尚服装数据或利用单模态输入,这并未反映存在来自各类别的多模态数据的真实场景。本文中,我们提出 LPR4M,一个大规模多模态数据集,涵盖 34 个类别,包含 3 种模态(图像、视频和文本),规模是最公开可用数据集的 50 倍。LPR4M 包含多样的视频与噪声模态对,并呈现长尾分布,近似真实世界问题。此外,提出一种跨视图语义对齐(RICE)模型,从商品的图像与视频视图中学习判别性实例特征。这通过实例级对比学习与跨视图块级特征传播实现。提出一种新颖的块特征重建损失以惩罚跨视图块间的语义错位。大量实验证明了 RICE 的有效性,并揭示了数据集多样性与表达力的重要性。数据集与代码发布于 https://github.com/adxcreative/RICE
引用
@article{arxiv.2308.04912,
title = {Cross-view Semantic Alignment for Livestreaming Product Recognition},
author = {Wenjie Yang and Yiyi Chen and Yan Li and Yanhua Cheng and Xudong Liu and Quan Chen and Han Li},
journal= {arXiv preprint arXiv:2308.04912},
year = {2023}
}
备注
Accepted to ICCV2023