中文

面向高效音视频视频字幕生成的知识蒸馏

音频与语音处理 2023-06-19 v1

摘要

用文本自动描述音视频内容,即视频字幕生成,因其在多个领域的潜在应用而受到广泛关注。深度神经网络是主流方法,可提供最先进的性能。然而,由于模型参数规模庞大,这些方法往往无法部署在智能手机等低功耗设备上。本文中,我们提出利用简易池化前端与下采样算法,并结合知识蒸馏处理音频与视觉属性,所用音视频帧数量减少。在教师模型知识蒸馏的辅助下,我们所提方法大幅减少了音视频流中的冗余信息,且不丢失字幕生成的关键上下文。在 MSR-VTT 数据集上的大量实验评估表明,所提方法将推理时间缩短约 80%,而字幕生成精度损失极小(低于 0.02%)。

关键词

引用

@article{arxiv.2306.09947,
  title  = {Knowledge Distillation for Efficient Audio-Visual Video Captioning},
  author = {Özkan Çaylı and Xubo Liu and Volkan Kılıç and Wenwu Wang},
  journal= {arXiv preprint arXiv:2306.09947},
  year   = {2023}
}

备注

European Signal Processing Conference (EUSIPCO 2023)