中文

通过对抗训练生成多样化音频描述

音频与语音处理 2024-07-02 v2 人工智能 多媒体 声音

摘要

自动音频描述是一项用自然语言句子描述音频片段内容的跨模态翻译任务。该任务近年受到越来越多关注并取得实质性进展。现有模型生成的描述通常忠实于音频片段内容,但这些机器生成的描述往往具有确定性(如给定音频片段生成固定描述)、简单性(如使用常见词汇与简单语法)与通用性(如对相似音频片段生成相同描述)。当人们被要求描述音频片段内容时,不同人倾向于关注不同声音事件,并从不同方面使用不同词汇与语法对音频片段进行多样化描述。我们认为音频描述系统应具备生成多样化描述的能力,无论针对固定音频片段还是跨相似音频片段。为此,我们提出一种基于条件生成对抗网络(C-GAN)的对抗训练框架,以提升音频描述系统的多样性。一个描述生成器与两个混合判别器相互竞争并联合学习,其中描述生成器可为任意用于生成描述的标准编码器-解码器描述模型,混合判别器从不同标准(如自然度与语义)评估生成描述。我们在 Clotho 数据集上开展实验,结果表明所提模型相较 SOTA 方法能生成多样性更好的描述。

关键词

引用

@article{arxiv.2212.02033,
  title  = {Towards Generating Diverse Audio Captions via Adversarial Training},
  author = {Xinhao Mei and Xubo Liu and Jianyuan Sun and Mark D. Plumbley and Wenwu Wang},
  journal= {arXiv preprint arXiv:2212.02033},
  year   = {2024}
}

备注

Accepted to TASLP