超越单音频:推进音频大语言模型的多音频处理
声音
2024-11-07 v3 人工智能
计算与语言
多媒体
音频与语音处理
摘要
近期已有各种音频LLM(ALLMs)被探索用于通过单一统一模型同时处理不同的音频任务。尽管目前对ALLMs的评估主要集中于单音频任务,但实际应用往往涉及同时处理多个音频流。为弥补这一空白,我们提出了首个多音频评估(MAE)基准,包含来自11个多音频任务的20个数据集,涵盖语音和声音场景。在MAE上的综合实验表明,现有的ALLMs虽然在理解单个音频输入中的主要音频元素方面功能强大,但在处理多音频场景时却面临困难。为此,我们提出了一种新颖的多音频LLM(MALLM),利用对我们提出的合成数据的判别学习,捕捉多个相似音频之间的音频上下文。结果表明,所提出的MALLM优于所有基线,并在无需人工标注的情况下,利用合成数据实现了高数据效率。所提出的MALLM为ALLMs开启了迈向多音频处理时代的大门,并使我们更接近在机器中复制人类听觉能力。
引用
@article{arxiv.2409.18680,
title = {Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models},
author = {Yiming Chen and Xianghu Yue and Xiaoxue Gao and Chen Zhang and Luis Fernando D'Haro and Robby T. Tan and Haizhou Li},
journal= {arXiv preprint arXiv:2409.18680},
year = {2024}
}
备注
EMNLP24 Findings. Data available at https://github.com/MatthewCYM/MALLM