中文

AudioStory:利用大型语言模型生成长篇叙事音频

计算机视觉与模式识别 2025-10-06 v2 多媒体 声音

摘要

近期文本转音频(TTA)生成的进展在合成短音频片段方面表现出色,但在生成长篇叙事音频方面存在困难,后者需要时间一致性和组合推理能力。为填补这一空白,我们提出了AudioStory,一个将大型语言模型(LLM)与TTA系统集成的统一框架,用于生成结构化、长篇音频叙事。AudioStory具有强大的指令遵循推理生成能力。它利用LLM将复杂的叙事查询分解为具有上下文提示的时间有序子任务,实现连贯的场景转换和情感基调一致性。AudioStory具有两个引人注目的特点:(1)解耦桥接机制:AudioStory将LLM与扩散器的协作分解为两个专门组件,即用于事件内语义对齐的桥接查询和用于跨事件一致性保持的残差查询。(2)端到端训练:通过统一指令理解和音频生成于单一的端到端框架中,AudioStory消除了对模块化训练流水线的需求,同时增强了组件间的协同性。此外,我们建立了AudioStory-10K基准,涵盖动画声景和自然声音叙事等多样化领域。大量实验表明AudioStory在单音频生成和叙事音频生成方面均优于先前TTA基线,在指令遵循能力和音频保真度上均表现优异。我们的代码可在https://github.com/TencentARC/AudioStory获取。

关键词

引用

@article{arxiv.2508.20088,
  title  = {AudioStory: Generating Long-Form Narrative Audio with Large Language Models},
  author = {Yuxin Guo and Teng Wang and Yuying Ge and Shijie Ma and Yixiao Ge and Wei Zou and Ying Shan},
  journal= {arXiv preprint arXiv:2508.20088},
  year   = {2025}
}