集成专家模型与情境理解的全方位音频查询处理系统
音频与语音处理
2024-12-06 v1
摘要
本文提出了一个综合性聊天机器人系统,旨在通过集成多个专门的音频处理模型来处理广泛范围的音频查询。该系统使用在多样化音频查询数据集上训练的意图分类器,将关于音频内容的查询路由到专家模型,如自动语音识别(ASR)、说话人分割、音乐识别和文本到音频生成。然后,一个 38 亿参数的大型语言模型(LLM)采集来自音频上下文检测(ACD)模块提取的音频事件信息,并对来自专家模型的文本域输出进行后处理,以计算最终响应。我们在自定义音频任务和 MMAU 声音数据集上对系统进行了评估。这些自定义数据集源于行业基准中未覆盖的目标用例,包括 ACD 时间戳-问答(Question Answering)以及 ACD 时序-问答数据集,用于评估时间戳和时序推理问题。首先,我们确定基于 BERT 的意图分类器在路由查询方面优于 LLM-Fewshot 意图分类器。实验进一步表明,我们的方法在某些自定义任务上比当前的大型音频语言模型和在 MMAU 声音测试集中性能更好的 7B 参数模型表现更佳,从而为设备内部署提供了吸引人的选择。
引用
@article{arxiv.2412.03980,
title = {Comprehensive Audio Query Handling System with Integrated Expert Models and Contextual Understanding},
author = {Vakada Naveen and Arvind Krishna Sridhar and Yinyi Guo and Erik Visser},
journal= {arXiv preprint arXiv:2412.03980},
year = {2024}
}