与视频同步的文本到音频生成
声音
2024-03-14 v1 人工智能
计算机视觉与模式识别
机器学习
多媒体
音频与语音处理
摘要
近年来,随着研究人员努力从文本描述合成音频,文本到音频(TTA)生成受到了越来越多的关注。然而,大多数现有方法虽然利用潜在扩散模型来学习音频和文本嵌入之间的相关性,但在保持生成的音频与其视频之间的无缝同步方面存在不足。这通常会导致明显的视听不匹配。为了弥补这一差距,我们引入了一个开创性的基准测试,用于与视频对齐的文本到音频生成,名为 T2AV-Bench。该基准测试以其三个专门用于评估视觉对齐和时间一致性的新颖指标而著称。作为补充,我们还提出了一个简单而有效的视频对齐 TTA 生成模型,即 T2AV。超越传统方法,T2AV 通过整合视觉对齐的文本嵌入作为其条件基础来改进潜在扩散方法。它采用时间多头注意力变换器来提取和理解视频数据中的时间细微差别,这一能力由我们的视听 ControlNet 增强,该网络巧妙地将时间视觉表示与文本嵌入融合在一起。为了进一步增强这种整合,我们引入了一个对比学习目标,旨在确保视觉对齐的文本嵌入与音频特征紧密共鸣。在 AudioCaps 和 T2AV-Bench 上的广泛评估表明,我们的 T2AV 在确保视觉对齐和时间一致性方面为视频对齐的 TTA 生成树立了新的标准。
引用
@article{arxiv.2403.07938,
title = {Text-to-Audio Generation Synchronized with Videos},
author = {Shentong Mo and Jing Shi and Yapeng Tian},
journal= {arXiv preprint arXiv:2403.07938},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2305.12903