中文

通过对抗训练实现多样化音频描述生成

音频与语音处理 2022-03-30 v2 声音

摘要

音频描述旨在为音频片段自动生成自然语言描述。现有音频描述模型近年来已展现出可喜的改进。然而,这些模型大多通过最大似然估计(MLE)训练,往往使描述趋于通用、简单且确定化。由于不同人可能从不同方面使用不同词汇与语法来描述同一音频片段,我们认为音频描述系统应具备为固定音频片段及相似音频片段生成多样化描述的能力。为解决此问题,我们提出了一种基于条件生成对抗网络(C-GAN)的音频描述对抗训练框架,旨在提升生成描述的自然度与多样性。与经典 GAN 中处理连续值数据不同,句子由离散词符组成,且离散采样过程不可微。为解决该问题,采用强化学习技术策略梯度将奖励反向传播至生成器。结果表明,与最先进方法相比,我们所提模型能生成更多样化的描述。

关键词

引用

@article{arxiv.2110.06691,
  title  = {Diverse Audio Captioning via Adversarial Training},
  author = {Xinhao Mei and Xubo Liu and Jianyuan Sun and Mark D. Plumbley and Wenwu Wang},
  journal= {arXiv preprint arXiv:2110.06691},
  year   = {2022}
}

备注

5 pages, 1 figure, accepted by ICASSP 2022