发现并因果验证大型音频-语言模型中的情感敏感神经元
计算与语言
2026-01-07 v1 音频与语音处理
摘要
情感是口头交际的核心维度,但我们仍缺乏对现代大型音频-语言模型(LALM)内部情感编码机制的因果解释。我们提出首个LALM情感敏感神经元(ESN)的神经元级可解释性研究,并为Qwen2.5-Omni、Kimi-Audio和Audio Flamingo 3三个模型提供了因果证据。针对这三个广泛使用的开源模型,我们比较了基于频率、熵、幅值和对比度的神经元选择器在多个情感识别基准上的表现。通过推理时干扰,我们揭示一致的情感特定签名:抑制特定情感选定的神经元会显著损害该情感识别,同时基本保留其他类别;而增益放大则将预测引向目标情感。这些效应在有限识别数据下即可显现,并随干扰强度系统性放大。我们进一步观察到ESN在层级上呈现非均匀聚类,并在部分跨数据集迁移。总体而言,本研究提供了LALM情感决策的因果、神经元级解释,突显目标神经元干扰作为可控情感行为的可操作句柄。
关键词
引用
@article{arxiv.2601.03115,
title = {Discovering and Causally Validating Emotion-Sensitive Neurons in Large Audio-Language Models},
author = {Xiutian Zhao and Björn Schuller and Berrak Sisman},
journal= {arXiv preprint arXiv:2601.03115},
year = {2026}
}
备注
16 pages, 6 figures