基于纯文本训练的弱监督自动音频描述
声音
2023-09-22 v1 机器学习
音频与语音处理
摘要
近年来,配对的音频与描述数据集使得自动生成音频片段描述(即自动音频描述,AAC)取得了显著成功。然而,收集足够数量的配对音频与描述费时费力。受对比语言-音频预训练(CLAP)近期进展的启发,我们提出一种弱监督方法来训练 AAC 模型,该方法仅假设有文本数据和预训练的 CLAP 模型,从而缓解对配对目标数据的需求。我们的方法利用 CLAP 中音频与文本嵌入之间的相似性。训练期间,我们学习从 CLAP 文本嵌入重建文本;推理期间,我们使用音频嵌入进行解码。为缓解音频与文本嵌入之间的模态鸿沟,我们在训练和推理阶段采用策略来弥合该鸿沟。我们在 Clotho 和 AudioCaps 数据集上评估所提方法,证明其相比使用配对目标数据全监督训练的方法能达到最高约 的相对性能。
引用
@article{arxiv.2309.12242,
title = {Weakly-supervised Automated Audio Captioning via text only training},
author = {Theodoros Kouzelis and Vassilis Katsouros},
journal= {arXiv preprint arXiv:2309.12242},
year = {2023}
}
备注
DCASE Workshop 2023