仅凭图像进行语音翻译
音频与语音处理
2024-06-12 v1 计算与语言
声音
摘要
视觉锚定语音模型将语音与图像关联。我们通过链接图像到文本的现有图像描述系统,扩展了这种关联,从而获得将语音音频直接映射到文本的能力。该方法可用于仅凭图像进行语音翻译,通过将音频置于不同于生成描述的语言中。我们在一种真实的低资源语言——Yor\`uba 上进行测试,提出了一个利用预训练组件的 Yor\`uba 到英语语音翻译模型,以便在资源有限的条件下进行学习。为限制过拟合,我们发现使用产生多样化图像描述的解码方案对于训练至关重要。结果表明,预测的翻译捕获了 spoken audio 的主要语义,尽管形式更简单、更简短。
引用
@article{arxiv.2406.07133,
title = {Translating speech with just images},
author = {Dan Oneata and Herman Kamper},
journal= {arXiv preprint arXiv:2406.07133},
year = {2024}
}
备注
Accepted at Interspeech 2024