CoNeTTE:一种利用多数据集与任务嵌入的高效音频描述系统
声音
2023-09-04 v1 音频与语音处理
摘要
自动音频描述(AAC)旨在使用编码器-解码器架构生成音频内容的自然语言描述。音频编码器产生音频嵌入并输入解码器(通常为Transformer解码器)以生成描述。本工作中,我们描述了我们的模型,其与现有模型的新颖之处在于使用ConvNeXt架构作为音频编码器,该架构从视觉领域适配至音频分类。此模型称为CNext-trans,在AudioCaps (AC) 数据集上取得了最先进分数,并在Clotho (CL) 上具竞争力,同时所用参数量比现有模型少四至四十倍。我们通过考察无偏编码器对性能的影响,研究了AC数据集因其源于AudioSet而可能存在的偏置。例如,使用知名的PANN's CNN14作为无偏编码器,我们观察到SPIDEr分数绝对下降1.7%(分数越高表示性能越好)。为提升跨数据集性能,我们结合多个AAC数据集(AC、CL、MACS、WavCaps)进行训练实验。尽管该策略增强了模型跨数据集的整体性能,仍不及在单一目标数据集上专门训练的模型,表明不存在一刀切的模型。为缓解数据集间性能差距,我们引入任务嵌入(TE) token,使模型能识别每个输入样本的来源数据集。我们提供了这些TE对生成描述的形式(词语)与内容(声音事件类型)影响的见解。所得模型名为CoNeTTE,一种 enriched with 数据集特定任务嵌入的无偏CNext-trans模型,在AC与CL上分别取得44.1%与30.5%的SPIDEr分数。代码见:https://github.com/Labbeti/conette-audio-captioning。
引用
@article{arxiv.2309.00454,
title = {CoNeTTE: An efficient Audio Captioning system leveraging multiple datasets with Task Embedding},
author = {Étienne Labbé and Thomas Pellegrini and Julien Pinquier},
journal= {arXiv preprint arXiv:2309.00454},
year = {2023}
}