WaveTransformer:一种基于时序与时频信息学习的音频字幕新架构
声音
2020-10-22 v1 机器学习
多媒体
音频与语音处理
摘要
自动化音频字幕(AAC)是一项新颖任务,方法以音频样本为输入并输出其内容的文本描述(即字幕)。多数 AAC 方法改编自机器翻译领域的图像字幕。本工作中我们提出一种新颖的 AAC 方法,明确聚焦于利用音频中的时序与时频模式。我们采用三个可学习过程进行音频编码:两个用于提取局部与时序信息,一个用于融合前两个过程的输出。为生成字幕,我们采用广泛使用的 Transformer 解码器。我们利用 Clotho 数据集的公开划分评估我们的方法。我们的结果将此前报道的最高 SPIDEr 从 16.2 提升至 17.3。
引用
@article{arxiv.2010.11098,
title = {WaveTransformer: A Novel Architecture for Audio Captioning Based on Learning Temporal and Time-Frequency Information},
author = {An Tran and Konstantinos Drossos and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2010.11098},
year = {2020}
}
备注
Submitted for review at ICASSP2021