中文

MINT:通过多目标预训练和指令微调提升音频-语言模型

声音 2024-06-13 v5 音频与语音处理

摘要

在音频-语言预训练(ALP)领域,实现跨模态对齐是一项重大挑战。此外,集成具有不同分布和任务变化的音频输入,给开发通用音频-语言模型带来了困难。在本研究中,我们提出了MINT,一种新颖的ALP框架,通过多目标预训练和指令微调来提升音频-语言模型。MINT利用冻结的预训练音频编码器和大型语言模型(LLM)的优势来改进音频-语言预训练,使其能够有效迁移到音频-文本理解和生成任务。为了解决模态差距,我们引入了Bridge-Net,一个可训练的模块,它增强了跨模态对齐以及模型遵循指令完成各种音频-文本任务的能力。Bridge-Net在MINT中至关重要,首先通过多目标预训练方法增强音频-语言表示学习。随后,Bridge-Net通过将冻结的语言模型与指令微调相结合,进一步提升了音频到语言的生成学习。这种集成使MINT能够以灵活有效的方式提取特征,特别是针对不同任务所提供的指令进行定制。实验结果表明,MINT在各种音频-语言理解和生成任务中均取得了优越的性能,突显了其即使在零样本场景下也具有强大的泛化能力。

关键词

引用

@article{arxiv.2402.07485,
  title  = {MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning},
  author = {Hang Zhao and Yifei Xin and Zhesong Yu and Bilei Zhu and Lu Lu and Zejun Ma},
  journal= {arXiv preprint arXiv:2402.07485},
  year   = {2024}
}