模型听得像我们吗?探究音频LLM与自然语境EEG的表征对齐性
声音
2026-02-04 v2 人工智能
音频与语音处理
摘要
音频大型语言模型(Audio LLM)在将语音感知与语言理解相结合方面展现出强大的能力。然而,这些模型的内部表征是否与人类在自然语境听力期间的神经动力学保持一致,目前仍鲜有探讨。本文系统性地检验了12个开源Audio LLM与脑电图(EEG)信号之间在图层级表征对齐性。具体而言,我们采用8种相似性度量标准(如以斯佩曼相关分析为代表的RSA)来刻画句子内表征几何。我们的分析揭示了三个关键发现:(1)我们观察到一种基于排名的差异,导致不同相似性度量标准下模型排名存在显著差异;(2)我们识别出由深度相关联峰和在250-500毫秒时间窗内RSA显著增长所特徴的时空对齐模式,这与N400相关的神经动力学相符;(3)我们发现情感异构性,即通过我们提出的三模态邻域一致性(TNC)准则识别的负面语调,会降低几何相似性,同时增强协方差式依赖性。这些发现为音频LLM的表征机制提供了新的神经生物学视角。
引用
@article{arxiv.2601.16540,
title = {Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG},
author = {Haoyun Yang and Xin Xiao and Jiang Zhong and Yu Tian and Dong Xiaohua and Yu Mao and Hao Wu and Kaiwen Wei},
journal= {arXiv preprint arXiv:2601.16540},
year = {2026}
}