基于对比学习的交互式音频-文本表示用于自动音频描述
声音
2022-04-13 v2 计算与语言
音频与语音处理
摘要
自动音频描述(AAC)是一项跨模态任务,旨在生成自然语言以描述输入音频的内容。大多数先前工作通常提取单模态声学特征,因而对跨模态解码任务而言是次优的。本工作中,我们提出一种称为 CLIP-AAC 的新型 AAC 系统,利用声学与文本信息学习交互式跨模态表示。具体而言,所提 CLIP-AAC 在预训练编码器中引入音频头与文本头以提取音频-文本信息。此外,我们还应用对比学习,通过学习音频信号与其配对描述之间的对应关系来缩小领域差异。实验结果表明,所提 CLIP-AAC 方法在 Clotho 数据集上以 NLP 评估指标显著优于最佳基线。消融研究指出,预训练模型与对比学习均对 AAC 模型性能提升有贡献。
引用
@article{arxiv.2203.15526,
title = {Interactive Audio-text Representation for Automated Audio Captioning with Contrastive Learning},
author = {Chen Chen and Nana Hou and Yuchen Hu and Heqing Zou and Xiaofeng Qi and Eng Siong Chng},
journal= {arXiv preprint arXiv:2203.15526},
year = {2022}
}
备注
Submitted to Interspeech 2022