中文

基于多特征集与并行注意力的有监督视频摘要

计算机视觉与模式识别 2021-05-14 v2 人工智能 信息检索 机器学习 多媒体

摘要

为视频中特定帧或(短)片段分配重要性分数对摘要至关重要,但也是一项困难任务。先前工作仅利用单一视觉特征来源。本文提出一种结合三组用于视觉内容与运动的特征以预测重要性分数的新模型架构。所提架构在融合运动特征与代表(静态)视觉内容的特征(即由图像分类模型导出)之前使用注意力机制。在两个知名数据集SumMe和TVSum上报告了全面的实验评估。在此背景下,我们指出了先前工作使用这些基准数据集的方法论问题,并提出了可用于未来工作的带适当数据划分的公平评估方案。当使用静态与运动特征及并行注意力机制时,我们在SumMe上改进了SOTA结果,而在另一数据集上与SOTA相当。

关键词

引用

@article{arxiv.2104.11530,
  title  = {Supervised Video Summarization via Multiple Feature Sets with Parallel Attention},
  author = {Junaid Ahmed Ghauri and Sherzod Hakimov and Ralph Ewerth},
  journal= {arXiv preprint arXiv:2104.11530},
  year   = {2021}
}

备注

Accepted in IEEE International Conference on Multimedia and Expo (ICME) 2021 (They have copyright to publish camera ready version of this work)