中文

SGPA:面向多模态大语言模型的可行性Shapley值解释的声谱图引导的语音对齐

声音 2026-03-04 v1 音频与语音处理

摘要

在原生分词方法下,无法通过Shapley值归因来解释端到端音频语言模型的行为:典型语音输入会产生超过150150个编码器帧,导致联合空间相对于文本增加约104210^{42}倍;单个音频帧缺乏独立意义;且分割语音过渡的词边界会引入掩模效应。我们引入声谱图引导语音对齐(SGPA),是一个四阶段管道,结合连接主义时序分类(CTC)强制对齐与频谱边界细化,生成声学上稳定且对齐单词的音频片段。基于LFM2-Audio-1.5B和VoiceBench的受控诊断显示,SGPA可实现模型评估次数降低4343倍。统计检验确认,SGPA显著改变归因分布浓度,同时保持全局累计轮廓,确立其作为音频可解释性不可行性缓解层的地位。

关键词

引用

@article{arxiv.2603.02250,
  title  = {SGPA: Spectrogram-Guided Phonetic Alignment for Feasible Shapley Value Explanations in Multimodal Large Language Models},
  author = {Paweł Pozorski and Jakub Muszyński and Maria Ganzha},
  journal= {arXiv preprint arXiv:2603.02250},
  year   = {2026}
}

备注

Submitted for admission in Interspeech 2026 conference