中文

EDSNet:高效DSNet用于视频摘要

计算机视觉与模式识别 2024-09-24 v1 人工智能 机器学习

摘要

当前的视频摘要方法主要依赖基于转换器的架构,这些方法由于其二次复杂度,需要大量计算资源。本文通过增强Direct-to-Summarize Network (DSNet) 于更高效的token混合机制来解决这些效率问题。我们表明,用傅里叶变换、小波变换和Nystr"omformer等替代方案取代传统注意力机制,可提高效率和性能。此外,我们探索了区域提议网络中各种池化策略,包括ROI池化、快速傅里叶变换池化和平坦池化。在TVSum和SumMe数据集上的实验结果表明,这些修改显著降低了计算成本,同时保持了具竞争力的摘要性能。因此,我们的工作为视频摘要任务提供了更可扩展的解决方案。

关键词

引用

@article{arxiv.2409.14724,
  title  = {EDSNet: Efficient-DSNet for Video Summarization},
  author = {Ashish Prasad and Pranav Jeevan and Amit Sethi},
  journal= {arXiv preprint arXiv:2409.14724},
  year   = {2024}
}

备注

10 pages, 5 figures