中文

超越特征融合:基于语境的贝叶斯PEFT用于多模态不确定性估计

机器学习 2026-04-21 v1 人工智能

摘要

我们提出CoCo-LoRA,这是一种面向伴随音频语境的文本预测任务的多模态、不确定性感知的参数高效微调方法。现有PEFT方法如LoRA虽高效,但通常为确定性方法,而近期贝叶斯低秩适配器以轻量方式建模不确定性但仍主要单模态,主要基于内部文本特征条件化不确定性。这使得其难以反映由外部声学因素(如背景噪声、信道变异或说话风格)驱动的不确定性,这些因素在语音相关应用中可能显著影响可靠性。CoCo-LoRA通过在低秩空间中构建语境变分后验,同时将本地文本衍生的适配器特征和音频派生的语境信号作为条件,来解决这一问题。将池化音频嵌入一次性投射到共享语境空间,然后通过轻量级层级头进行适配,实现从全局到局部、基于深度的不确定性和更新调制,而无需高维多模态融合。随机性局限于秩空间中的紧凑潜在组件,保持了PEFT的可扩展性,同时产生面向音频的异方差不确定性。基于我们的评估,CoCo-LoRA在多样化任务和主干组合上始终与文本-only PEFT和常规特征融合迁移基准相当或更好,尤其在高覆盖标签上,其中可靠的适应性至关重要。结果表明,将音频作为语境不确定性信号而非作为融合特征流,为多模态低资源预测提供了一种稳健且参数高效的替代方案。

关键词

引用

@article{arxiv.2604.16615,
  title  = {Beyond Feature Fusion: Contextual Bayesian PEFT for Multimodal Uncertainty Estimation},
  author = {Habibeh Naderi and Behrouz Haji Soleimani and Stan Matwin},
  journal= {arXiv preprint arXiv:2604.16615},
  year   = {2026}
}