中文

在大型音频语言模型中重焕副语言意识

声音 2026-03-13 v1 计算与语言 多媒体 音频与语音处理

摘要

大型音频语言模型已将与人交互扩展至语音模态,由于副语言线索隐含地指示了用户上下文,这带来了巨大的交互潜力。然而,基于当前以内容为中心的范式,大型音频语言模型通常忽略此类副语言线索,仅根据查询内容进行响应。在这项工作中,为了重焕大型音频语言模型中的副语言意识,我们引入了五种不同的逐层分析方法,以联合识别副语言层和语义理解层。基于这些见解,我们相应地提出了一种副语言增强微调协议,以赋予大型音频语言模型副语言感知能力,包括:(1) 选择性层微调,以及 (2) 一个辅助的双层分类头。我们的实验表明,副语言增强微调协议高效且有效地重焕了副语言意识,其性能甚至超越了全层微调策略。

关键词

引用

@article{arxiv.2603.11947,
  title  = {Resurfacing Paralinguistic Awareness in Large Audio Language Models},
  author = {Hao Yang and Minghan Wang and Tongtong Wu and Lizhen Qu and Ehsan Shareghi and Gholamreza Haffari},
  journal= {arXiv preprint arXiv:2603.11947},
  year   = {2026}
}

备注

Submitted to Interspeech 2026