Poet:面向电商的产品导向视频描述生成器
计算机视觉与模式识别
2020-08-18 v1
摘要
在电子商务中,越来越多的用户生成视频被用于产品推广。如何生成叙述视频中所描绘的用户偏好产品特征的视频描述,对于成功推广至关重要。传统视频描述方法侧重于常规描述视频中存在和发生的事情,不适用于产品导向的视频描述。为解决此问题,我们提出了一个产品导向视频描述框架,简称为 Poet。Poet 首先将视频表示为产品导向的时空图。然后,基于视频关联产品的各个方面,我们在这些图上执行知识增强的时空推理,以捕捉细粒度产品部件特征的动态变化。Poet 中的知识利用模块不同于传统设计,其执行知识过滤与动态记忆建模。我们表明,在生成质量、产品方面捕捉和词汇多样性方面,Poet 相较先前方法取得了一致的性能提升。实验在两个产品导向视频描述数据集上进行,即从手机淘宝收集的买家生成时尚视频数据集(BFVD)和粉丝生成时尚视频数据集(FFVD)。我们将发布脱敏数据集,以促进对视频描述及通用视频分析问题的进一步研究。
引用
@article{arxiv.2008.06880,
title = {Poet: Product-oriented Video Captioner for E-commerce},
author = {Shengyu Zhang and Ziqi Tan and Jin Yu and Zhou Zhao and Kun Kuang and Jie Liu and Jingren Zhou and Hongxia Yang and Fei Wu},
journal= {arXiv preprint arXiv:2008.06880},
year = {2020}
}
备注
10 pages, 3 figures, to appear in ACM MM 2020 proceedings