用于自动音频字幕生成的Prefix Tuning方法
音频与语音处理
2023-04-05 v2 多媒体
声音
摘要
音频字幕生成旨在从环境声音中生成文本描述。音频字幕生成的一个挑战是由于缺乏音频-文本配对训练数据而难以泛化。在这项工作中,我们提出了一种简单而有效的方法,通过利用预训练语言模型来处理小规模数据集。我们保持语言模型冻结以维持文本生成的表达能力,仅学习从输入音频中提取全局和时序特征。为了弥合音频特征与语言模型之间的模态鸿沟,我们采用映射网络将音频特征转换为语言模型能够理解的连续向量,称为前缀(prefixes)。我们在 Clotho 和 AudioCaps 数据集上评估了所提出的方法,并表明我们的方法在多种实验设置下优于先前的方法。
引用
@article{arxiv.2303.17489,
title = {Prefix tuning for automated audio captioning},
author = {Minkyu Kim and Kim Sung-Bin and Tae-Hyun Oh},
journal= {arXiv preprint arXiv:2303.17489},
year = {2023}
}
备注
ICASSP 2023