中文

音频字幕任务中音频预训练模型选择的研究

声音 2022-08-15 v1 机器学习 音频与语音处理

摘要

音频字幕是一项基于内容生成音频描述的任务。由于高复杂性,预训练模型被广泛用于音频字幕。除非重新训练整个系统,否则很难确定预训练模型对音频字幕系统的贡献程度。为避免耗时的重训练过程,有必要为音频字幕中的预训练模型提出一种性能预测器。本文研究了一系列预训练模型,考察所提取音频特征与音频字幕性能之间的相关性。基于实验结果提出了若干预测器。结果表明,由于音频特征的峰度和偏度与音频字幕系统性能高度相关,其可作为预训练音频的音频字幕系统性能的指标。

关键词

引用

@article{arxiv.2208.06127,
  title  = {An investigation on selecting audio pre-trained models for audio captioning},
  author = {Peiran Yan and Shengchen Li},
  journal= {arXiv preprint arXiv:2208.06127},
  year   = {2022}
}

备注

5 pages, 7 figures