中文

RiTTA:文本到音频生成中的事件关系建模

机器学习 2026-04-10 v4 声音 音频与语音处理

摘要

尽管文本到音频(TTA)生成模型在实现高保真音频和细粒度语境理解方面取得了显著进展,但它们在建模输入文本中描述的音频事件之间的关系方面仍面临挑战。然而,之前的TTA方法尚未系统性地探索音频事件关系建模,也未提出相应的框架来增强这一能力。本工作系统性地研究了TTA生成模型中的音频事件关系建模。我们首先通过以下方式建立了该任务基准:1. 提出一个全面的关系语料库,覆盖真实场景中可能的全部关系;2. 引入新的音频事件语料库,涵盖常见听见的音频;3. 提出新的评估指标,从多个角度评估音频事件关系建模能力。此外,我们提出了一种微调框架来增强现有TTA模型建模音频事件关系的能力。代码已公开:https://github.com/yuhanghe01/RiTTA

引用

@article{arxiv.2412.15922,
  title  = {RiTTA: Modeling Event Relations in Text-to-Audio Generation},
  author = {Yuhang He and Yash Jain and Xubo Liu and Andrew Markham and Vibhav Vineet},
  journal= {arXiv preprint arXiv:2412.15922},
  year   = {2026}
}

备注

EMNLP25, Project Site: https://yuhanghe01.github.io/RiTTA-Proj/. Code: https://github.com/yuhanghe01/RiTTA