中文

仔细听并描述:基于残差学习与 Gammatone 音频表示的音频字幕系统

音频与语音处理 2020-07-09 v4 机器学习 声音

摘要

自动音频字幕是一项机器听觉任务,其目标是用自由文本描述一段音频。自动音频字幕系统须以接受音频作为输入并输出文本描述(即信号的字幕)的方式实现。该任务在许多应用中都很有用,例如自动内容描述或机器到机器的交互。本工作中,提出了一种在编码器阶段基于残差学习的自动音频字幕方法。编码器阶段通过不同的残差网络(Residual Networks)配置实现。解码器阶段(生成字幕)使用循环层加注意力机制运行。所选择的音频表示为 Gammatone。结果表明,本工作提出的框架在挑战赛结果上超越了基线系统。

关键词

引用

@article{arxiv.2006.15406,
  title  = {Listen carefully and tell: an audio captioning system based on residual learning and gammatone audio representation},
  author = {Sergi Perez-Castanos and Javier Naranjo-Alcazar and Pedro Zuccarello and Maximo Cobos},
  journal= {arXiv preprint arXiv:2006.15406},
  year   = {2020}
}

备注

Submitted to DCASE2020 Workshop, Workshop on Detection and Classification of Acoustic Scenes and Events