查询两次:用于视频摘要的双重混合注意力元学习
计算机视觉与模式识别
2020-08-20 v1 多媒体
摘要
视频摘要旨在选择代表性帧以保留高层信息,通常通过 softmax 函数预测片段级重要性分数来解决。然而,softmax 函数在保留复杂视觉或序列信息的高秩表示方面存在不足,即所谓的 Softmax 瓶颈问题。在本文中,我们提出了一种名为双重混合注意力(DMASum)模型结合元学习用于视频摘要的新框架,解决了 softmax 瓶颈问题,其中混合注意力层(MoA)通过采用两次自查询注意力有效增加模型容量,除了初始的查询-键注意力外还能捕捉二阶变化,然后引入一种新颖的单帧元学习规则,以对训练资源有限的小数据集实现更好的泛化。此外,DMASum 显著利用了视觉和序列注意力,以累积方式连接局部关键帧和全局注意力。我们在两个公开数据集 SumMe 和 TVSum 上采用了新的评估协议。定性和定量实验均表明相对于最先进的方法有显著改进。
引用
@article{arxiv.2008.08360,
title = {Query Twice: Dual Mixture Attention Meta Learning for Video Summarization},
author = {Junyan Wang and Yang Bai and Yang Long and Bingzhang Hu and Zhenhua Chai and Yu Guan and Xiaolin Wei},
journal= {arXiv preprint arXiv:2008.08360},
year = {2020}
}
备注
This manuscript has been accepted at ACM MM 2020