中文

评估现成的机器听觉与自然语言模型在自动音频描述中的应用

机器学习 2021-10-15 v1 计算与语言 声音 音频与语音处理

摘要

自动音频描述(AAC)是一项为通用音频信号自动生成文本描述的任务。一个描述系统必须从输入信号中识别各种信息,并用自然语言将其表达出来。现有工作主要侧重于研究新方法,并试图提升其在现有数据集上测得的性能。由于该领域近期才引起关注,研究现有预训练音频和自然语言处理资源在AAC中性能的工作极少。本文中,我们采用基于Transformer的描述方法评估现成模型的性能。我们利用公开可用的Clotho数据集,在多种不同设置下比较了四种不同的预训练机器聆听模型、四种词嵌入模型及其组合。我们的评估表明,YAMNet与BERT嵌入相结合能产生最佳的描述。此外,通常而言,微调预训练的词嵌入可以带来更好的性能。最后,我们展示了使用Transformer编码器处理音频嵌入序列可以生成更高质量的描述。

关键词

引用

@article{arxiv.2110.07410,
  title  = {Evaluating Off-the-Shelf Machine Listening and Natural Language Models for Automated Audio Captioning},
  author = {Benno Weck and Xavier Favory and Konstantinos Drossos and Xavier Serra},
  journal= {arXiv preprint arXiv:2110.07410},
  year   = {2021}
}

备注

5 pages, 4 figures. Accepted at Detection and Classification of Acoustic Scenes and Events 2021 (DCASE2021)