在无音频条件下训练音频描述模型
音频与语音处理
2023-09-15 v1 声音
摘要
自动音频描述(AAC)是给定音频流生成自然语言描述的任务。典型的AAC系统需要人工整理的音频片段与对应文本描述标注的训练数据。这些音频-描述对的创建成本高昂,导致该任务普遍存在数据稀缺。本工作中,我们解决这一主要局限,并提出仅使用文本训练AAC系统的方法。我们的方法利用了对比训练的音频-文本模型(如CLAP)的多模态空间。训练期间,解码器基于预训练的CLAP文本编码器生成描述。推理期间,文本编码器被预训练的CLAP音频编码器替换。为弥合文本与音频嵌入之间的模态鸿沟,我们提出在训练期间使用噪声注入或可学习适配器。我们发现所提出的纯文本框架与利用配对音频训练的state-of-the-art模型相比具有竞争力,表明高效的文本到音频迁移是可行的。最后,我们展示了在无音频或人工创建文本描述情况下的风格化音频描述与描述 enrichment。
引用
@article{arxiv.2309.07372,
title = {Training Audio Captioning Models without Audio},
author = {Soham Deshmukh and Benjamin Elizalde and Dimitra Emmanouilidou and Bhiksha Raj and Rita Singh and Huaming Wang},
journal= {arXiv preprint arXiv:2309.07372},
year = {2023}
}