中文

基于词频的音频描述前后处理之效果

音频与语音处理 2020-09-25 v1 计算与语言 机器学习 声音

摘要

我们用于声学场景与事件检测及分类(DCASE) 2020挑战赛任务6(自动音频描述)的系统结合了三个要素,即数据增强、多任务学习和后处理,用于音频描述。该系统获得了最高的评测分数,但其中哪个单独要素对其性能贡献最大尚未阐明。在此,为评估它们的贡献,我们首先对系统进行了逐要素消融研究,以估计每个要素的有效程度。然后我们进行了详细的逐模块消融研究,以进一步厘清提升精度的关键处理模块。结果表明数据增强和后处理显著提升了我们系统中的分数。特别地,mix-up数据增强和后处理中的束搜索分别使SPIDEr提升了0.8和1.6分。

关键词

引用

@article{arxiv.2009.11436,
  title  = {Effects of Word-frequency based Pre- and Post- Processings for Audio Captioning},
  author = {Daiki Takeuchi and Yuma Koizumi and Yasunori Ohishi and Noboru Harada and Kunio Kashino},
  journal= {arXiv preprint arXiv:2009.11436},
  year   = {2020}
}

备注

Accepted to DCASE2020 Workshop