Speak the Art:直接语音到图像生成框架
音频与语音处理
2026-01-13 v2 人工智能
多媒体
摘要
直接语音到图像生成最近取得了令人鼓舞的进展。然而,与文本到图像生成相比,仍存在较大差距。当前方法采用两阶段方法来解决此任务:语音编码网络和图像生成对抗网络(GAN)。这些方法中的语音编码网络产生的嵌入向量未能捕获足够的语言信息以语义地表示输入语音。GAN存在收敛性差、模式坍缩和梯度减弱等问题,导致模型参数不稳定、样本多样性受限和生成器学习无效。为缓解这些缺陷,我们引入一种名为Speak the Art(STA)的框架,包含语音编码网络和以语音嵌入为条件的VQ-Diffusion网络。为改进语音嵌入,语音编码网络在训练期间受大规模预训练图像-文本模型的监督。用扩散方法取代GAN,实现更稳定的训练并生成多样化图像。此外,我们研究了将框架扩展至多语言可行性。作为概念验证,我们使用两种语言(英语和阿拉伯语)训练了该框架。最后,我们展示了结果在最新方法上取得显著优势。
引用
@article{arxiv.2601.00827,
title = {Speak the Art: A Direct Speech to Image Generation Framework},
author = {Mariam Saeed and Manar Amr and Farida Adel and Nada Hassan and Nour Walid and Eman Mohamed and Mohamed Hussein and Marwan Torki},
journal= {arXiv preprint arXiv:2601.00827},
year = {2026}
}