基于机器翻译数据的多语言音频描述生成
声音
2023-09-15 v1 音频与语音处理
摘要
自动音频描述生成(AAC)系统试图生成一句自然语言句子(即描述),从声音事件的角度描述一段音频录音的内容。现有数据集提供音频-描述对,且描述仅以英文撰写。在本工作中,我们借助机器翻译描述探索多语言 AAC。我们将两个知名 AAC 数据集 AudioCaps 与 Clotho 从英文自动翻译为法文、德文与西班牙文。我们在 AudioCaps 与 Clotho 上以四种语言训练并评估了单语系统。所有情况下,模型均取得相近表现:AudioCaps 上约 75% CIDEr,Clotho 上约 43%。在法文中,我们获取了 AudioCaps 评估子集的人工描述。与将输出自动译为法文的英文系统相比,在 AudioCaps 机器翻译版上训练的法文系统在人工评估子集上取得了显著更优的结果。这支持为目标语言构建系统,而非简单地将英文系统的英文描述翻译至目标语言。最后,我们构建了一个多语言模型,其在每种语言上的结果可与各单语系统相媲美,同时所用参数量远少于单语系统集合。
引用
@article{arxiv.2309.07615,
title = {Multilingual Audio Captioning using machine translated data},
author = {Matéo Cousin and Étienne Labbé and Thomas Pellegrini},
journal= {arXiv preprint arXiv:2309.07615},
year = {2023}
}