基于词频的音频描述前后处理之效果
音频与语音处理
2020-09-25 v1 计算与语言
机器学习
声音
摘要
我们用于声学场景与事件检测及分类(DCASE) 2020挑战赛任务6(自动音频描述)的系统结合了三个要素,即数据增强、多任务学习和后处理,用于音频描述。该系统获得了最高的评测分数,但其中哪个单独要素对其性能贡献最大尚未阐明。在此,为评估它们的贡献,我们首先对系统进行了逐要素消融研究,以估计每个要素的有效程度。然后我们进行了详细的逐模块消融研究,以进一步厘清提升精度的关键处理模块。结果表明数据增强和后处理显著提升了我们系统中的分数。特别地,mix-up数据增强和后处理中的束搜索分别使SPIDEr提升了0.8和1.6分。
引用
@article{arxiv.2009.11436,
title = {Effects of Word-frequency based Pre- and Post- Processings for Audio Captioning},
author = {Daiki Takeuchi and Yuma Koizumi and Yasunori Ohishi and Noboru Harada and Kunio Kashino},
journal= {arXiv preprint arXiv:2009.11436},
year = {2020}
}
备注
Accepted to DCASE2020 Workshop