中文

面向视频标题生成的综合信息融合建模框架

计算机视觉与模式识别 2020-06-25 v1 机器学习 多媒体

摘要

在电商领域,消费者生成视频体量巨大,通常传达消费者对特定产品不同方面的个人偏好。为更有效地将这些视频推荐给潜在消费者,多样且吸引人的视频标题至关重要。然而,消费者生成视频很少配有恰当标题。为弥补这一缺口,我们在端到端建模框架中融合综合信息源,包括消费者生成视频内容、消费者提供的叙述性评论语句以及产品属性。尽管自动视频标题生成非常有用且需求迫切,但其受关注程度远不及视频字幕生成。后者侧重于生成描述整体视频的句子,而我们的任务需要产品感知的多粒度视频分析。为解决此问题,所提方法包含两方面过程,即粒度级交互建模与抽象级故事线摘要。具体而言,粒度级交互建模首先利用时空地标线索、描述性词语和抽象属性构建三个独立图,并通过图神经网络(GNN)识别各图内交互。随后提出全局—局部聚合模块以建模跨图交互并将异质图聚合为整体图表示。抽象级故事线摘要进一步考虑帧级视频特征与整体图,利用产品与背景间交互生成视频的故事线主题。我们据此从全球领先电商平台淘宝的真实世界数据中收集大规模数据集,并将发布脱敏版本以滋养研究界的进一步发展……

关键词

引用

@article{arxiv.2006.13608,
  title  = {Comprehensive Information Integration Modeling Framework for Video Titling},
  author = {Shengyu Zhang and Ziqi Tan and Jin Yu and Zhou Zhao and Kun Kuang and Tan Jiang and Jingren Zhou and Hongxia Yang and Fei Wu},
  journal= {arXiv preprint arXiv:2006.13608},
  year   = {2020}
}

备注

11 pages, 6 figures, to appear in KDD 2020 proceedings