解码器驱动的视频-文本到语音多模态同步机制:洞察
多媒体
2026-04-21 v3 计算机视觉与模式识别
声音
音频与语音处理
摘要
统一解码器式转换器在多模态生成方面显示出前景,但它们如何同步采样率不同的模态仍未得到充分探讨。我们通过视频-文本到语音(VTTS)合成来研究这些机制——这是一种需要在稀疏文本、视频和连续语音之间实现细粒度时间对齐的受控任务。使用在 VoxCeleb2 上训练的统一解码器式转换器(称为 Visatronic),我们研究:(i)不同模态如何贡献互补信息,(ii)位置编码策略如何实现跨异构率率的同步,(iii)模态排序如何影响域内性能与跨域迁移之间的权衡,(iv)音素级同步指标如何为每个音素的时序误差提供诊断性见解。我们的发现表明,既有“全局顺序索引”(跨模态唯一位置 ID)又有“共时有序索引”(对应时段标记相同 ID)能够实现强大的同步性能,其中共时有序索引提供一种无需显式时间戳元数据的简单机制。文本和视频都贡献互补信号:文本确保语音可理解性,而视频提供时间线索和情感表达。模态排序揭示了一致的权衡:视频优先排序实现更强的域内性能,而文本优先排序在面对未知域时更具可迁移性。我们的发现还表明,多样化的大规模训练可实现可迁移的同步策略。为实现细粒度分析,我们还引入了 TimeSync,一种音素级指标,揭示了帧级指标所忽略的时序错位。这些见解将 VTTS 确立为理解统一多模态解码器中时间同步的有价值测试场。
引用
@article{arxiv.2411.17690,
title = {Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis},
author = {Akshita Gupta and Tatiana Likhomanenko and Karren Dai Yang and Richard He Bai and Zakaria Aldeneh and Navdeep Jaitly},
journal= {arXiv preprint arXiv:2411.17690},
year = {2026}
}
备注
30 pages, Decoder-only model, Speech Synthesis