使用合成字幕与迁移学习训练的用于音频字幕的 Whisper transformer
声音
2023-05-18 v1 机器学习
音频与语音处理
摘要
近年来,在大规模音频数据集可用性与深度学习技术进步的推动下,音频字幕领域取得了显著进展。在本技术报告中,我们介绍了我们的音频字幕方法,重点在于使用预训练的语音转文本 Whisper 模型以及在合成字幕上进行预训练。我们讨论了训练流程并展示了实验结果,包括模型规模变化、数据集混合以及其他超参数。我们的发现展示了不同训练策略对音频字幕模型性能的影响。我们的代码与训练模型已在 GitHub 与 Hugging Face Hub 上公开可用。
引用
@article{arxiv.2305.09690,
title = {A Whisper transformer for audio captioning trained with synthetic captions and transfer learning},
author = {Marek Kadlčík and Adam Hájek and Jürgen Kieslich and Radosław Winiecki},
journal= {arXiv preprint arXiv:2305.09690},
year = {2023}
}