中文

面向高效音频大语言模型训练的异构感知数据调度

声音 2026-05-20 v1 机器学习

摘要

跨越多样化数据集训练通用音频大语言模型 (ALLM) 是实现全方位音频理解的必由之路,但面临数据异构性带来的显著挑战,这往往导致梯度冲突和收敛速度缓慢。尽管其影响巨大,但如何在训练过程中显式管理这种异构性仍属未充分探索的领域,现有实践主要依赖均匀混合。在本工作中,我们从收敛角度分析了多数据集 AudioQA 训练,提出了分组顺序训练 (GST) 方法。GST 战略性地将数据集组织为亲和感知知的组,并通过渐进式调度协议引入,有效平衡了并行训练的稳定性与顺序优化的效率。为确保可扩展性,我们开发了基于梯度的亲和感度度量,无需昂贵的经验迁移估计即可捕捉数据集间的关系。广泛评估了 14 个 AudioQA 数据集(涵盖语音、音乐和环境声),表明 GST 在标准并行训练中实现 30--40% 的更快收敛速度,同时保持甚至超越混合训练的性能。我们的结果提供了理论见解和实用、模型无关的高效大规模 ALLM 优化框架。

关键词

引用

@article{arxiv.2605.19101,
  title  = {Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training},
  author = {Yanru Wu and Jianning Wang and Chongxin Gan and Yang Li},
  journal= {arXiv preprint arXiv:2605.19101},
  year   = {2026}
}