中文

基于句子级损失的车内场景音频描述

声音 2020-10-26 v2 计算与语言 音频与语音处理

摘要

描述生成在图像和视频理解中已引起广泛关注,而少量工作考察了音频描述。本文贡献了一个用于车内场景音频描述的普通话标注数据集。提出了一种句子级损失,与GRU编码器-解码器模型结合使用,以生成与人类标注具有更高语义相似度的描述。我们在新提出的Car数据集、先前发布的普通话Hospital数据集和Joint数据集上评估了该模型,表明其跨不同场景的泛化能力。可以观察到所有指标上的提升,包括经典的自然语言生成(NLG)指标、句子丰富度和人类评估评分。然而,尽管现在可以自动生成详细的音频描述,人类标注在许多方面仍优于模型描述。

关键词

引用

@article{arxiv.1905.13448,
  title  = {Audio Caption in a Car Setting with a Sentence-Level Loss},
  author = {Xuenan Xu and Heinrich Dinkel and Mengyue Wu and Kai Yu},
  journal= {arXiv preprint arXiv:1905.13448},
  year   = {2020}
}