中文

Text2Move:通过轨迹预测与时间对齐实现文本到运动声音生成

声音 2025-09-29 v1 音频与语音处理

摘要

人类听觉感知是由 3D 空间中运动的声音源塑造的,然而生成式声音建模的先前工作主要局限于单声道信号或静态空间音频。在本工作中,我们引入了一个框架,以可控的方式根据文本提示生成运动声音。为了实现训练,我们构建了一个合成数据集,记录了双声道格式的运动声音、其空间轨迹,以及关于声音事件和空间运动的文本描述。使用该数据集,我们训练了一个文本到轨迹预测模型,该模型根据文本提示输出运动声源的三维轨迹。为了生成空间音频,我们首先微调预训练的文本到音频生成模型,以输出与轨迹时间对齐的单声道声音。然后使用预测的时间对齐轨迹来模拟空间音频。实验评估表明,文本到轨迹模型具有合理的空间理解能力。该方法可以轻松集成到现有的文本到音频生成工作流中,并扩展到其他空间音频格式的运动声音生成。

关键词

引用

@article{arxiv.2509.21919,
  title  = {Text2Move: Text-to-moving sound generation via trajectory prediction and temporal alignment},
  author = {Yunyi Liu and Shaofan Yang and Kai Li and Xu Li},
  journal= {arXiv preprint arXiv:2509.21919},
  year   = {2025}
}