中文

面向可控音频生成的动态事件图引导扩散Transformer —— DegDiT

机器人学 2025-09-30 v2

摘要

可控文本到音频生成旨在满足用户指定约束(包括事件类型、时间序列以及起始和结束时间戳)地合成音频,从而实现对生成音频内容和时间结构的精确控制。尽管近期进展,但现有方法仍在准确时间局部化、开放词汇可扩展性和实际效率之间存在内在权衡。为此,我们提出DegDiT:一种 novel dynamic event graph-guided diffusion transformer框架,用于开放词汇可控音频生成。DegDiT将描述中的事件编码为结构化动态图。图中节点设计用于表示三个方面:语义特征、时间属性以及事件间连接。采用图变换器整合这些节点,生成用于指导扩散模型的情境化事件嵌入。为确保高质量且多样化的训练数据,我们引入一种质量平衡数据选择管道,将层次事件注释与多准则评分结合, resulting in 一个语义多样化的精选数据集。此外,我们提出共识偏好优化,促进通过多个奖励信号共识的音频生成。在AudioCondition、DESED和AudioTime数据集上的大量实验表明,DegDiT在多种客观和主观评估指标上实现了最新成果。

关键词

引用

@article{arxiv.2508.13785,
  title  = {Blast Hole Seeking and Dipping -- The Navigation and Perception Framework in a Mine Site Inspection Robot},
  author = {Liyang Liu and Ehsan Mihankhah and Nathan Wallace and Javier Martinez and Andrew J. Hill},
  journal= {arXiv preprint arXiv:2508.13785},
  year   = {2025}
}