中文

紧盯提示词:提升声学分类的音频生成提示策略

音频与语音处理 2025-04-07 v1 人工智能 声音 信号处理

摘要

本文探讨了如何为基于文本生成音频(Text-To-Audio, TTA)模型设计有效提示策略,以生成真实的数据集。我们还分析了不同技术如何高效组合这些数据集以增强其在声学分类任务中的实用性。通过对两种声学分类数据集与两种 TTA 模型进行评估,我们应用了一系列提示策略。我们的发现表明,针对特定任务的提示策略在数据生成方面显著优于基本提示方法。此外,合并使用不同 TTA 模型生成的数据集比仅增加训练数据规模更有效地提升了分类性能。总体而言,本文的結果凸显了这些方法作为有效数据增强技术的优势。

关键词

引用

@article{arxiv.2504.03329,
  title  = {Mind the Prompt: Prompting Strategies in Audio Generations for Improving Sound Classification},
  author = {Francesca Ronchini and Ho-Hsiang Wu and Wei-Cheng Lin and Fabio Antonacci},
  journal= {arXiv preprint arXiv:2504.03329},
  year   = {2025}
}

备注

Accepted at Generative Data Augmentation for Real-World Signal Processing Applications Workshop