基于数据调度的低资源阿拉伯语音LLM多任务指令调优
声音
2026-03-24 v2 人工智能
计算与语言
音频与语音处理
摘要
Audio大型语言模型(LLM)实现了统一的语音理解与生成,但在阿拉伯语-英语等语言结构复杂且方言丰富的环境中仍存在挑战。我们对一种阿拉伯语中心化的音频LLM进行多任务指令调优进行受控研究,涵盖生成性任务(包括语音识别和语音与文本摘要)和判别性任务(包括方言和情感识别),在资源受限的环境中进行。为支持端到端的阿拉伯语语音摘要,我们引入AraMega-SSum,首个用于训练和基准测试阿拉伯语中心化Audio-LLM的语音摘要资源。我们比较了四种训练策略(i)统一任务混合、(ii)任务渐进式课程(TPC)、(iii)基于对齐器的多样化采样(ADS)用于训练时 batch构建,以及(iv)一种两阶段TPC->ADS策略。我们的结果显示,效率-鲁棒性之间存在明确的权衡。ADS加速了早期收敛并改进了语义行为性能,但会损害其他任务。两种阶段的TPC->ADS策略提供了最可靠的整体平衡,为在低资源、方言丰富的环境中适配全能音频LLM提供了实用指导。我们将公开AraMega-SSum及所有实验资源。
引用
@article{arxiv.2601.12494,
title = {Multi-Task Instruction Tuning via Data Scheduling for Low-Resource Arabic AudioLLMs},
author = {Hunzalah Hassan Bhatti and Firoj Alam and Shammur Absar Chowdhury},
journal= {arXiv preprint arXiv:2601.12494},
year = {2026}
}
备注
Foundation Models, Large Language Models, Native, Speech Models, Arabic