SGPA:面向多模态大语言模型的可行性Shapley值解释的声谱图引导的语音对齐
声音
2026-03-04 v1 音频与语音处理
摘要
在原生分词方法下,无法通过Shapley值归因来解释端到端音频语言模型的行为:典型语音输入会产生超过个编码器帧,导致联合空间相对于文本增加约倍;单个音频帧缺乏独立意义;且分割语音过渡的词边界会引入掩模效应。我们引入声谱图引导语音对齐(SGPA),是一个四阶段管道,结合连接主义时序分类(CTC)强制对齐与频谱边界细化,生成声学上稳定且对齐单词的音频片段。基于LFM2-Audio-1.5B和VoiceBench的受控诊断显示,SGPA可实现模型评估次数降低倍。统计检验确认,SGPA显著改变归因分布浓度,同时保持全局累计轮廓,确立其作为音频可解释性不可行性缓解层的地位。
引用
@article{arxiv.2603.02250,
title = {SGPA: Spectrogram-Guided Phonetic Alignment for Feasible Shapley Value Explanations in Multimodal Large Language Models},
author = {Paweł Pozorski and Jakub Muszyński and Maria Ganzha},
journal= {arXiv preprint arXiv:2603.02250},
year = {2026}
}
备注
Submitted for admission in Interspeech 2026 conference