Zipper:用于融合多模态的多塔解码器架构
机器学习
2024-06-03 v2 人工智能
计算与语言
音频与语音处理
摘要
将多个生成式基础模型,尤其是在不同模态上进行训练的模型,整合成比各个部分都更强大的整体,面临着显著的挑战。这两个关键障碍是对齐数据(概念在不同模态中以不同方式表达,但意义相似)的可用性,以及在不损害其原始单模态能力的前提下,有效地利用单模态表示进行跨域生成任务。我们提出了Zipper,一种多塔解码器架构,通过使用跨注意力灵活地从独立预训练的单模态解码器中构建多模态生成模型。在将语音和文本模态融合的实验中,我们展示了该架构在有限对齐文本-语音数据场景下的表现非常出色。我们还展示了该模型的灵活性,能够通过冻结相应的模态塔(例如文本)来选择性地维持单模态(例如文本到文本生成)生成性能。在输出模态为文本的跨模态任务中,如自动语音识别(ASR),我们显示,冻结文本主干网络可导致性能几乎不受影响。在输出模态为语音的跨模态任务中,如文本到语音生成(TTS),我们显示,使用预训练的语音主干网络可实现优于基线的性能。
引用
@article{arxiv.2405.18669,
title = {Zipper: A Multi-Tower Decoder Architecture for Fusing Modalities},
author = {Vicky Zayats and Peter Chen and Melissa Ferrari and Dirk Padfield},
journal= {arXiv preprint arXiv:2405.18669},
year = {2024}
}
备注
Under review at NeurIPS