融合声学与语义信息的音频描述生成
声音
2021-05-14 v1 机器学习
音频与语音处理
摘要
生成音频描述是一个结合音频与自然语言处理以为音频片段创建有意义文本描述的新研究领域。为解决此问题,以往研究大多使用基于编码器-解码器的模型而未考虑语义信息。为填补这一空白,我们提出一种使用带有音频与语义嵌入的双向门控循环单元(BiGRU)的新型编码器-解码器架构。我们通过从音频片段描述中获取主语和动词来提取语义嵌入,并将这些嵌入与音频嵌入结合以输入基于BiGRU的编码器-解码器模型。为使测试音频获得语义嵌入,我们引入一个多层感知机分类器来预测这些片段的语义嵌入。我们还进行了详尽实验以展示不同特征与数据集对我们所提音频描述任务的模型的有效性。为提取音频特征,我们使用对数梅尔能量特征、VGGish嵌入和预训练音频神经网络(PANN)嵌入。在两个音频描述数据集Clotho和AudioCaps上的广泛实验表明,我们所提模型在不同评估指标上优于最先进的音频描述模型,且使用语义信息提升了描述性能。关键词:音频描述;PANNs;VGGish;GRU;BiGRU。
引用
@article{arxiv.2105.06355,
title = {Audio Captioning with Composition of Acoustic and Semantic Information},
author = {Ayşegül Özkaya Eren and Mustafa Sert},
journal= {arXiv preprint arXiv:2105.06355},
year = {2021}
}
备注
Accepted for publication in International Journal of Semantic Computing. arXiv admin note: substantial text overlap with arXiv:2006.03391