评估现成的机器听觉与自然语言模型在自动音频描述中的应用
机器学习
2021-10-15 v1 计算与语言
声音
音频与语音处理
摘要
自动音频描述(AAC)是一项为通用音频信号自动生成文本描述的任务。一个描述系统必须从输入信号中识别各种信息,并用自然语言将其表达出来。现有工作主要侧重于研究新方法,并试图提升其在现有数据集上测得的性能。由于该领域近期才引起关注,研究现有预训练音频和自然语言处理资源在AAC中性能的工作极少。本文中,我们采用基于Transformer的描述方法评估现成模型的性能。我们利用公开可用的Clotho数据集,在多种不同设置下比较了四种不同的预训练机器聆听模型、四种词嵌入模型及其组合。我们的评估表明,YAMNet与BERT嵌入相结合能产生最佳的描述。此外,通常而言,微调预训练的词嵌入可以带来更好的性能。最后,我们展示了使用Transformer编码器处理音频嵌入序列可以生成更高质量的描述。
引用
@article{arxiv.2110.07410,
title = {Evaluating Off-the-Shelf Machine Listening and Natural Language Models for Automated Audio Captioning},
author = {Benno Weck and Xavier Favory and Konstantinos Drossos and Xavier Serra},
journal= {arXiv preprint arXiv:2110.07410},
year = {2021}
}
备注
5 pages, 4 figures. Accepted at Detection and Classification of Acoustic Scenes and Events 2021 (DCASE2021)