EDSNet:高效DSNet用于视频摘要
计算机视觉与模式识别
2024-09-24 v1 人工智能
机器学习
摘要
当前的视频摘要方法主要依赖基于转换器的架构,这些方法由于其二次复杂度,需要大量计算资源。本文通过增强Direct-to-Summarize Network (DSNet) 于更高效的token混合机制来解决这些效率问题。我们表明,用傅里叶变换、小波变换和Nystr"omformer等替代方案取代传统注意力机制,可提高效率和性能。此外,我们探索了区域提议网络中各种池化策略,包括ROI池化、快速傅里叶变换池化和平坦池化。在TVSum和SumMe数据集上的实验结果表明,这些修改显著降低了计算成本,同时保持了具竞争力的摘要性能。因此,我们的工作为视频摘要任务提供了更可扩展的解决方案。
引用
@article{arxiv.2409.14724,
title = {EDSNet: Efficient-DSNet for Video Summarization},
author = {Ashish Prasad and Pranav Jeevan and Amit Sethi},
journal= {arXiv preprint arXiv:2409.14724},
year = {2024}
}
备注
10 pages, 5 figures