中文

MUKA:面向音频语言模型的多核音频适配

量子代数 2026-02-17 v1

摘要

多模态基础模型展现出惊人的泛化能力,但在零样或少量样本场景中高效适配新任务仍是关键挑战。本文我们通过训练式和非训练式方法,探索大型音频语言模型(ALMs)的少样本适配。我们引入MUKA,一种多核适配框架,将基于指令微调模型如Pengi的细粒度、上下文依赖表示与基于对比预训练方法如CLAP的全局语义表示相结合。通过构建产品核对齐局部相似性与全局语义,MUKA在保持核方法理论保证的同时增强了表征能力,无需额外训练。广泛的实验在11个多样化音频数据集上表明,MUKA在训练免费方法中实现了最先进性能,甚至在几个场景中超越了训练式适配器,展现了在可适应性与效率之间取得 compelling 平衡的引人注目的效果。

关键词

引用

@article{arxiv.2602.14126,
  title  = {Revisiting the Algebraic and Analytic Descriptions of Quantum Mechanics},
  author = {Ortwin Fromm and Felicitas Ehlen},
  journal= {arXiv preprint arXiv:2602.14126},
  year   = {2026}
}

备注

13 pages