中文

他们在做什么?音频与语音联合协同推理

声音 2025-01-14 v2 计算与语言 音频与语音处理

摘要

在音频和语音处理中,即使同一音频片段中同时存在声音和人声,任务通常也只关注音频或语音单一模态。近期的听觉大语言模型 (ALLMs) 使得在单一模型内同时处理音频和语音成为可能,从而引发了对音频-语音联合任务的进一步思考。在本文中,我们建立了一个新颖的基准测试,以探究 ALLMs 在执行音频-语音联合处理时的表现。具体而言,我们提出了音频-语音联合协同推理 (JASCO),这是一项统一音频和语音处理的新颖任务,严格要求在两种模态间进行协同推理。我们还发布了一个名为“What Are They Doing”的场景推理数据集。此外,我们通过分析模型对每种模态的依赖性,为模型行为提供了更深入的见解。

关键词

引用

@article{arxiv.2409.14526,
  title  = {What Are They Doing? Joint Audio-Speech Co-Reasoning},
  author = {Yingzhi Wang and Pooneh Mousavi and Artem Ploujnikov and Mirco Ravanelli},
  journal= {arXiv preprint arXiv:2409.14526},
  year   = {2025}
}

备注

Accepted to ICASSP 2025