大型音频语言模型中音频-文本融合的因果追踪
声音
2026-03-17 v1 计算与语言
摘要
尽管大型音频语言模型 (LALM) 在各类任务中表现出强大的性能,但它们如何以及在何处整合声学特征与文本上下文仍不清晰。我们采用因果追踪方法来探讨 LALM 在音频理解期间的内部信息流。通过对 DeSTA、Qwen 和 Voxtral 进行逐层和逐 token 分析,我们评估单个隐藏状态的因果效应。层级分析识别出不同的融合策略, ranging from DeSTA 中的渐进式集成到 Qwen 中的突发性后期融合。token 级分析显示,最终序列 token 充当信息瓶颈,网络在此处决定性地检索音频中相关信息。我们还观察到在中间 token 位置处的类似注意力的查询机制,可触发模型从音频上下文中提取任务相关信息。这些发现为清晰刻画 LALM 内部多模态集成的时机与位置提供了依据。
引用
@article{arxiv.2603.13768,
title = {Causal Tracing of Audio-Text Fusion in Large Audio Language Models},
author = {Wei-Chih Chen and Chien-yu Huang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2603.13768},
year = {2026}
}
备注
Submitted to Interspeech 2026