中文

EmotionCaps:通过情感增强数据生成提升音频描述

声音 2024-10-17 v1 机器学习 音频与语音处理 信号处理

摘要

近期的音频语言建模进展,如自动音频描述,受益于使用大型语言模型辅助生成合成数据的训练。然而,这类方法在环境声描述中主要关注音频事件标签,未曾探索利用可能存在于录音中的情感信息。本工作中,我们探讨了通过指示ChatGPT附带语音情感信息来生成情感增强合成音频描述数据的好处。为此,我们引入EmotionCaps,一个约包含12万个音频剪辑的音频描述数据集,包含与声景情感识别(SER)信息配对的合成描述。我们假设,额外的信息将导致更高质量的描述,使其与音频录音的情感基调相匹配,从而提高训练此类数据的描述模型性能。我们通过客观和主观评估,比较使用EmotionCaps数据集训练的模型与多个基线模型的表现。我们的发现挑战了当前的描述方法,并建议新的方向来发展和评估描述模型。

关键词

引用

@article{arxiv.2410.12028,
  title  = {EmotionCaps: Enhancing Audio Captioning Through Emotion-Augmented Data Generation},
  author = {Mithun Manivannan and Vignesh Nethrapalli and Mark Cartwright},
  journal= {arXiv preprint arXiv:2410.12028},
  year   = {2024}
}