基于低维和高维特征融合的自动音频字幕生成
声音
2022-10-18 v1 机器学习
音频与语音处理
摘要
自动音频字幕生成旨在使用简单的句子描述音频片段的内容。现有的自动音频字幕生成方法基于编码器-解码器架构开发,其成功归因于使用名为 PANNs 的预训练 CNN10 作为编码器来学习丰富的音频表示。由于其高维能力空间涉及各种场景的音频,自动音频字幕生成是一项极具挑战性的任务。现有方法仅使用 PANNs 的高维表示作为解码器的输入。然而,低维表示可能保留与高维表示同样多的音频信息,这一点可能被忽视了。此外,尽管高维方法可以通过从现有的音频字幕中学习来预测音频字幕,但这缺乏鲁棒性和效率。为了应对这些挑战,提出了一种融合低维和高维特征的自动音频字幕生成框架融合模型。本文提出了一种新的编码器-解码器框架,称为用于自动音频字幕生成的低维和高维特征融合模型。此外,在 LHDFF 中,通过融合来自中间卷积层输出的低维特征和来自 PANNs 最后一层输出的高维特征,提出了一种新的 PANNs 编码器,称为残差 PANNs。为了分别充分利用低维和高维融合特征以及高维特征的信息,我们提出了双 Transformer 解码器结构来并行生成字幕。特别地,提出了一种概率融合方法,通过集中于两个 Transformer 解码器各自的优势,可以确保系统整体性能得到提升。实验结果表明,与其他现有模型相比,LHDFF 在 Clotho 和 AudioCaps 数据集上取得了最佳性能。
引用
@article{arxiv.2210.05037,
title = {Automated Audio Captioning via Fusion of Low- and High- Dimensional Features},
author = {Jianyuan Sun and Xubo Liu and Xinhao Mei and Mark D. Plumbley and Volkan Kilic and Wenwu Wang},
journal= {arXiv preprint arXiv:2210.05037},
year = {2022}
}