他们在做什么?音频与语音联合协同推理
声音
2025-01-14 v2 计算与语言
音频与语音处理
摘要
在音频和语音处理中,即使同一音频片段中同时存在声音和人声,任务通常也只关注音频或语音单一模态。近期的听觉大语言模型 (ALLMs) 使得在单一模型内同时处理音频和语音成为可能,从而引发了对音频-语音联合任务的进一步思考。在本文中,我们建立了一个新颖的基准测试,以探究 ALLMs 在执行音频-语音联合处理时的表现。具体而言,我们提出了音频-语音联合协同推理 (JASCO),这是一项统一音频和语音处理的新颖任务,严格要求在两种模态间进行协同推理。我们还发布了一个名为“What Are They Doing”的场景推理数据集。此外,我们通过分析模型对每种模态的依赖性,为模型行为提供了更深入的见解。
引用
@article{arxiv.2409.14526,
title = {What Are They Doing? Joint Audio-Speech Co-Reasoning},
author = {Yingzhi Wang and Pooneh Mousavi and Artem Ploujnikov and Mirco Ravanelli},
journal= {arXiv preprint arXiv:2409.14526},
year = {2025}
}
备注
Accepted to ICASSP 2025