中文

通过高级模态条件与交互驯服文本到语音视频生成

计算机视觉与模式识别 2025-10-06 v1 声音

摘要

本研究聚焦于一个具有挑战性却富有前景的任务:文本到语音视频(T2SV)生成,即从文本条件生成同步音频的视频,同时确保两种模态与文本对齐。尽管联合音视频训练已有进展,但仍有两个关键挑战未被解决:(1)单一共享文本标题(视频文本等于音频文本)常导致模态干扰,使预训练主干网络困惑;(2)最佳的跨模态特征交互机制尚不明确。为此,我们首先提出了层次化视觉 grounding 标题生成(HVGC)框架,该框架生成一对解缝的标题:视频标题和音频标题,从 conditioning 阶段消除干扰。基于HVGC,我们进一步引入BridgeDiT,一种新型双塔扩散变换器,采用双向交叉注意(DCA)机制作为稳健的“桥梁”,实现语义和时间上的双向信息交换,实现同步。大量实验在三个基准数据集上进行,支持人类评估,证明我们的方法在大多数指标上实现了最新成果。 comprehensive ablation 研究进一步验证了我们的贡献有效性,为未来T2SV任务提供了关键洞察。所有代码和模型 checkpoint 将公开发布。

关键词

引用

@article{arxiv.2510.03117,
  title  = {Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction},
  author = {Kaisi Guan and Xihua Wang and Zhengfeng Lai and Xin Cheng and Peng Zhang and XiaoJiang Liu and Ruihua Song and Meng Cao},
  journal= {arXiv preprint arXiv:2510.03117},
  year   = {2025}
}