基于不频繁类的多任务正则化用于音频字幕生成
声音
2020-07-10 v1 机器学习
多媒体
音频与语音处理
摘要
音频字幕生成是一项多模态任务,侧重于使用自然语言描述一般音频的内容。大多数音频字幕生成方法基于深度神经网络,采用编码器-解码器方案以及包含音频片段和相应自然语言描述(即字幕)的数据集。音频字幕生成面临的一个重大挑战是字幕中词汇的分布:一些词非常频繁但在声学上不提供信息,即虚词(如“a”、“the”);另一些词不频繁但提供信息,即实词(如形容词、名词)。在本文中,我们提出两种方法来缓解这种类别不平衡问题。首先,在音频字幕生成的自编码器设置中,我们将每个词对训练损失的贡献权重设置为与其在整个数据集中出现次数成反比。其次,除了多类、词级别的音频字幕生成任务外,我们还通过训练一个单独的解码器,基于片段级实词检测定义了一个多标签辅助任务。我们使用第二个任务的损失来联合正则化音频字幕生成任务训练的编码器。我们使用最近发布的大规模音频字幕生成数据集 Clotho 评估了我们的方法,结果表明,在 SPIDEr 指标上相比基线方法获得了 37% 的相对提升。
引用
@article{arxiv.2007.04660,
title = {Multi-task Regularization Based on Infrequent Classes for Audio Captioning},
author = {Emre Çakır and Konstantinos Drossos and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2007.04660},
year = {2020}
}