DCA:面向信息量丰富的直播视频评论的多样化协同注意力
计算机视觉与模式识别
2020-08-11 v3 计算与语言
机器学习
摘要
我们关注自动直播视频评论(ALVC)任务,其旨在以视频帧与其他观众的评论作为输入生成实时视频评论。该任务的一大挑战是如何恰当利用视频与文本所承载的丰富且多样的信息。本文中,我们旨在从视频与文本中收集多样化信息以生成信息丰富的评论。为此,我们提出了一种用于该任务的多样化协同注意力(DCA)模型。我们的模型通过度量学习从多视角建立视频帧与周边评论间的双向交互,以收集多样化且信息丰富的上下文用于评论生成。我们还提出了一种有效的参数正交化技术,以避免从不同视角学习的信息过度重叠。结果表明,我们的方法在ALVC任务上优于现有方法,取得了新的SOTA结果。
引用
@article{arxiv.1911.02739,
title = {DCA: Diversified Co-Attention towards Informative Live Video Commenting},
author = {Zhihan Zhang and Zhiyi Yin and Shuhuai Ren and Xinhang Li and Shicheng Li},
journal= {arXiv preprint arXiv:1911.02739},
year = {2020}
}