中文

DiVISe:直接视觉输入语音合成,保留说话人特征与可懂度

声音 2025-03-10 v1 计算机视觉与模式识别 机器学习 多媒体 音频与语音处理

摘要

视频到语音(V2S)合成,即从无声视频输入直接生成语音的任务,由于需要仅从视觉线索中准确重建语音内容和说话人特征,本质上比其他语音合成任务更具挑战性。最近,音频-视觉预训练消除了V2S对额外声学提示的需求,而此前方法通常依赖这些提示来确保训练收敛。然而,即使有了预训练,现有方法在实现声学可懂度与说话人特定特征保留之间的平衡方面仍面临挑战。我们分析了这一局限性,并受到启发提出了DiVISe(Direct Visual-Input Speech Synthesis),一个端到端的V2S模型,仅从视频帧直接预测梅尔频谱图。尽管不借助任何声学提示,DiVISe在生成音频中有效保留了说话人特征,并在LRS2和LRS3数据集上的客观和主观指标上取得了优越性能。我们的结果表明,DiVISe不仅在声学可懂度方面优于现有V2S模型,而且能更有效地随数据和模型参数规模的增加而扩展。代码和权重可在 https://github.com/PussyCat0700/DiVISe 获取。

关键词

引用

@article{arxiv.2503.05223,
  title  = {DiVISe: Direct Visual-Input Speech Synthesis Preserving Speaker Characteristics And Intelligibility},
  author = {Yifan Liu and Yu Fang and Zhouhan Lin},
  journal= {arXiv preprint arXiv:2503.05223},
  year   = {2025}
}

备注

to be published in NAACL 25