中文

AudioChat:基于 Transfusion Forcing 的统一音频叙事、编辑与理解框架

声音 2026-02-20 v1

摘要

尽管近期取得了突破,但音频基础模型在处理复杂多源声学场景时仍面临挑战。我们将这一具备挑战性的领域称为音频叙事,其可包含多个说话者及背景/前景音效。与传统音频处理任务相比,音频叙事引入了新的语义、时序和物理复杂度层次。为此,我们提出 AudioChat 框架,用于开发能够生成、编辑和理解音频叙事的音频基础模型。AudioChat 引入了新的范式:基于 LLM 的工具调用代理模拟用户与系统之间的交互,这些模拟对话被用作训练数据。我们还引入了新的 Audio Transfusion Forcing 目标函数,以训练 AudioChat 模型,使其能够通过结构化链式思考推理分解高层指令,同时执行交互式多轮音频理解和生成。为评估生成和编辑性能,我们开发了三个新的指标,直接衡量任务性能,而非依赖基于分布的评分。我们高度鼓励读者访问我们的演示,以更好地理解 AudioChat 的能力:https://wanchichen.github.io/audiochat/。

关键词

引用

@article{arxiv.2602.17097,
  title  = {AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing},
  author = {William Chen and Prem Seetharaman and Rithesh Kumar and Oriol Nieto and Shinji Watanabe and Justin Salamon and Zeyu Jin},
  journal= {arXiv preprint arXiv:2602.17097},
  year   = {2026}
}