用于查询聚焦视频摘要的卷积层次注意力网络
计算机视觉与模式识别
2023-07-19 v3
摘要
以往的视频摘要方法主要集中于寻找最具多样性和代表性的视觉内容作为视频摘要,而未考虑用户偏好。本文解决查询聚焦视频摘要任务,该任务以用户查询和长视频作为输入,旨在生成查询聚焦的视频摘要。在本文中,我们将该任务视为计算视频镜头与查询之间相似度的问题。为此,我们提出一种名为卷积层次注意力网络(CHAN)的方法,其由两部分组成:特征编码网络和查询相关性计算模块。在编码网络中,我们采用具有局部自注意力机制和查询感知全局注意力机制的卷积网络来学习每个镜头的视觉信息。编码后的特征将被送入查询相关性计算模块以生成查询聚焦的视频摘要。在基准数据集上的大量实验证明了具有竞争力的性能并显示了我们方法的有效性。
引用
@article{arxiv.2002.03740,
title = {Convolutional Hierarchical Attention Network for Query-Focused Video Summarization},
author = {Shuwen Xiao and Zhou Zhao and Zijian Zhang and Xiaohui Yan and Min Yang},
journal= {arXiv preprint arXiv:2002.03740},
year = {2023}
}
备注
Accepted by AAAI 2020 Conference