中文

Pengi:面向音频任务的音频语言模型

音频与语音处理 2024-01-22 v2 声音

摘要

在音频处理领域,迁移学习促进了自监督学习和零样本学习技术的兴起。这些方法催生了能够处理广泛任务同时提供最先进性能的通用模型。然而,当前模型天生缺乏为开放式任务(如音频描述或音频问答)生成所需语言的能力。我们介绍了 Pengi,一种新颖的音频语言模型,它通过将所有音频任务构建为文本生成任务来利用迁移学习。它以音频录音和文本作为输入,并生成自由形式的文本作为输出。输入的音频由音频编码器表示为连续嵌入序列。文本编码器对相应文本输入执行相同操作。两个序列被组合作为前缀以提示一个预训练的冻结语言模型。Pengi 的统一架构无需任何额外微调或任务特定扩展即可实现开放式任务和封闭式任务。在 22 个下游任务上评估时,我们的方法在其中若干任务上取得了最先进的性能。我们的结果表明,将语言模型与音频模型连接是迈向通用音频理解的重要一步。

关键词

引用

@article{arxiv.2305.11834,
  title  = {Pengi: An Audio Language Model for Audio Tasks},
  author = {Soham Deshmukh and Benjamin Elizalde and Rita Singh and Huaming Wang},
  journal= {arXiv preprint arXiv:2305.11834},
  year   = {2024}
}

备注

Accepted at NeurIPS 2023. The manuscript is updated with additional experiments suggested by reviewers