中文

基于多尺度特征的端到端视频字幕网络 EVC-MF

计算机视觉与模式识别 2024-10-23 v1 人工智能

摘要

传统视频字幕方法利用多种离线提取特征来生成字幕。尽管存在多种离线特征提取器可从不同视角提供多样化信息,但由于参数固定,这些提取器存在若干局限性。具体而言,这些提取器仅在图像/视频理解任务上进行预训练,导致在视频字幕数据集上适应性较差。此外,这些提取器大多只捕获预训练任务分类器之前的特征,忽略了相当数量的有价值的浅层信息。此外,使用多个离线特征可能引入冗余信息。为解决这些问题,我们提出一种端到端编码器-解码器网络 EVC-MF,用于视频字幕,有效利用多尺度视觉和文本特征生成视频描述。具体而言,EVC-MF 包含三个模块。首先,尽管依赖多个特征提取器,我们直接将视频帧输入基于 Transformer 的网络,以获取多尺度视觉特征并更新特征提取器参数。其次,我们融合多尺度特征并输入掩码编码器以减少冗余并鼓励学习有用特征。最后,我们利用增强型基于 Transformer 的解码器,能够有效利用浅层文本信息来生成视频描述。为评估我们提出的模型,我们在基准数据集上进行了大量实验。结果表明,EVC-MF 在与最先进方法之间取得了具竞争力的性能。

关键词

引用

@article{arxiv.2410.16624,
  title  = {EVC-MF: End-to-end Video Captioning Network with Multi-scale Features},
  author = {Tian-Zi Niu and Zhen-Duo Chen and Xin Luo and Xin-Shun Xu},
  journal= {arXiv preprint arXiv:2410.16624},
  year   = {2024}
}