中文

STAR:基于表示学习的语音到音频生成框架

声音 2025-09-23 v1 音频与语音处理

摘要

本文提出了 STAR,即首个面向语音到音频生成的端到端框架,旨在提升效率并解决级联系统中固有的误差传播问题。不同于依赖文本或视觉的先前方法,STAR 利用语音作为交互的自然模态。作为验证该系统可行性的初步步骤,我们通过表示学习实验表明, spoken sound event 语义可从原始语音中有效提取,既捕获听觉事件,也捕获场景线索。基于这些语义表示,STAR 引入了表示映射的桥接网络和两阶段训练策略,以实现端到端合成。STAR 在语音处理延迟降低 76.9% 的同时,显示出优于级联系统的优越生成性能。总体而言,STAR 将语音建立为音频生成的直接交互信号,从而桥接了表示学习与多模态合成。生成样本可在 https://zeyuxie29.github.io/STAR 查看。

关键词

引用

@article{arxiv.2509.17164,
  title  = {STAR: Speech-to-Audio Generation via Representation Learning},
  author = {Zeyu Xie and Xuenan Xu and Yixuan Li and Mengyue Wu and Yuexian Zou},
  journal= {arXiv preprint arXiv:2509.17164},
  year   = {2025}
}