中文

TTMBA:面向文本到多源全向音频生成的技术

声音 2025-11-06 v1 人工智能 音频与语音处理

摘要

大多数现有文本到音频(TTA)生成方法产生单声道输出,忽略了沉浸式听觉体验中必不可少的空间信息。为此,我们提出了一种用于文本到多源全向音频生成(TTMBA)的级联方法,具备时间和空间控制。首先,一个预训练的大语言模型(LLM)将文本分割为带有每个声音事件时间和空间细节的结构化格式。接着,一个预训练的单声道音频生成网络为每个事件创建多个持续时间不同的单声道音频。这些单声道音频使用来自LLM的空间数据通过全向渲染神经网络转换为全向音频。最后,按起始时间排列全向音频,得到多源全向音频。实验结果表明,所提方法在音频生成质量和空间感知精度方面均优于现有方法。

关键词

引用

@article{arxiv.2507.16564,
  title  = {TTMBA: Towards Text To Multiple Sources Binaural Audio Generation},
  author = {Yuxuan He and Xiaoran Yang and Ningning Pan and Gongping Huang},
  journal= {arXiv preprint arXiv:2507.16564},
  year   = {2025}
}

备注

5 pages,3 figures,2 tables