中文

面向不确定性感知的跨模态贝叶斯低秩适配

机器学习 2026-04-21 v1 人工智能

摘要

大型预训练语言模型正在通过参数高效微调(PEFT)适应下游任务,但现有PEFT方法通常是确定性的和单模态的,使其不适用于预测不确定性和跨模态可靠性都至关重要的低资源多模态设置。我们引入CALIBER(Context-Aware Low-rank Inference with Bayesian Embedding Regularization),一种用于音频-文本学习的多模态不确定性感知PEFT框架。CALIBER通过在适配器空间中对变分后验进行条件化,以实现贝叶斯低秩适配。具体而言,文本派生的低秩特征注意力地注意于帧级音频嵌入,以产生局部声学上下文,然后调制来自适配器空间中紧凑随机潜在矩阵的均值和方差。这种设计将音频不仅作为额外的特征来源,还是一种上下文可靠性信号,以塑造适配和置信度。通过将随机性限制在低维潜在组件中,CALIBER保持了PEFT的计算效率和可扩展性,同时实现了异方差多模态不确定性估计。在多样化的文本和音频 backbone 上进行的实验结果表明,CALIBER始终能够匹配或优于文本-only贝叶斯PEFT和常规多模态迁移学习基线,其中token-level跨注意力 yielding the most consistent gains。我们的发现表明,局部跨模态条件化是一种有效且轻量级的不确定性感知多模态适配机制。

关键词

引用

@article{arxiv.2604.16657,
  title  = {Cross-Modal Bayesian Low-Rank Adaptation for Uncertainty-Aware Multimodal Learning},
  author = {Habibeh Naderi and Behrouz Haji Soleimani and Stan Matwin},
  journal= {arXiv preprint arXiv:2604.16657},
  year   = {2026}
}