中文

PicoAudio:文本到音频生成中精确时间戳与频率可控性

声音 2024-07-18 v2 音频与语音处理

摘要

近期音频生成任务引发广泛关注。精确的时间可控性对于将音频生成集成到实际应用中至关重要。本文提出一种时间控制音频生成框架 PicoAudio。PicoAudio 通过量身设计的模型结构将时间信息纳入音频生成过程。它利用数据爬取、分割、过滤及仿真生成细粒度时序对齐的音频文本数据。主观评估与客观评估均表明,PicoAudio 在时间戳与发生频率可控性方面显著超越当前最先进的生成模型。生成样本已在演示网站 https://zeyuxie29.github.io/PicoAudio.github.io 上发布。

关键词

引用

@article{arxiv.2407.02869,
  title  = {PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation},
  author = {Zeyu Xie and Xuenan Xu and Zhizheng Wu and Mengyue Wu},
  journal= {arXiv preprint arXiv:2407.02869},
  year   = {2024}
}