基于双 Transformer 解码器的特征融合网络用于自动音频描述
音频与语音处理
2023-05-31 v1 声音
摘要
自动音频描述(AAC)生成音频内容的文本描述。现有 AAC 模型取得了良好结果,但仅使用了编码器的高维表示。由于高维表示包含大量信息,高维方法的信息学习总是不充分。本文提出一种称为低维与高维特征融合(LHDFF)的新编码器-解码器模型。LHDFF 使用一种称为残差 PANNs(RPANNs)的新 PANNs 编码器来融合低维与高维特征。低维特征包含有限的特定音频场景信息。低维与高维特征的融合可通过反复强调特定音频场景信息来提升模型性能。为充分利用融合特征,LHDFF 使用双 Transformer 解码器结构并行生成描述。实验结果表明 LHDFF 优于现有音频描述模型。
引用
@article{arxiv.2305.18753,
title = {Dual Transformer Decoder based Features Fusion Network for Automated Audio Captioning},
author = {Jianyuan Sun and Xubo Liu and Xinhao Mei and Volkan Kılıç and Mark D. Plumbley and Wenwu Wang},
journal= {arXiv preprint arXiv:2305.18753},
year = {2023}
}
备注
INTERSPEECH 2023. arXiv admin note: substantial text overlap with arXiv:2210.05037