中文

基于大型语言模型字幕增强的语言查询音频源分离性能提升——面向DCASE挑战赛2024任务9

音频与语音处理 2024-11-28 v2 人工智能 声音

摘要

我们提出了一种基于提示工程的文本增强方法,应用于语言查询音频源分离(LASS)任务。为了提升LASS的性能,所提出的方法利用大型语言模型(LLM)为训练数据集的每个句子生成多个对应字幕。为此,我们首先进行实验,以确定使用较少数量字幕进行字幕增强的最有效提示。使用这些增强字幕训练的LASS模型,在DCASE 2024任务9验证集上,相比未使用增强训练的模型,性能有所提升。本研究突显了基于LLM的字幕增强在推进语言查询音频源分离方面的有效性。

关键词

引用

@article{arxiv.2406.11248,
  title  = {Performance Improvement of Language-Queried Audio Source Separation Based on Caption Augmentation From Large Language Models for DCASE Challenge 2024 Task 9},
  author = {Do Hyun Lee and Yoonah Song and Hong Kook Kim},
  journal= {arXiv preprint arXiv:2406.11248},
  year   = {2024}
}

备注

DCASE 2024 Challenge Task 9, 4 pages