通过跨模态信息流解读与增强大型视觉-语言模型中的情感电路
计算机视觉与模式识别
2026-05-22 v1 人工智能
摘要
大型视觉-语言模型(LVLMs)代表了对共情主体的重大进步,展现出在情感理解方面的显著能力。然而,LVLMs 如何将抽象的视觉刺激转化为连贯的情感叙述的内部机制仍基本未知,主要由于视觉反事实样本的稀缺以及情感表达的扩散性。本文通过引入基于驾驶向量的因果归因框架,针对描述性情感推理构建了专门的框架。为此,我们构建了一个专门的数据集,以澄清 ``适应-聚合-执行'' 三阶段情感电路的工作机制。关键在于,我们发现了一种功能解耦现象:视觉情感线索通过情感特定注意力头在中层聚合,但随后通过情感通用路径在深层转化为叙事生成。在基于这些洞察的指导下,我们调节情感信息的路由,以强化注意力流动并放大语义激活,以巩固表达。广泛的实验在完整的 MER-UniBench 数据集上进行,表明我们的方法通过推理时干预显著提升了性能,有效缓解了情感幻觉问题,并证实了所发现电路的因果忠实性。
引用
@article{arxiv.2605.21980,
title = {Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow},
author = {Chengsheng Zhang and Chenghao Sun and Zhining Xie and Xinmei Tian},
journal= {arXiv preprint arXiv:2605.21980},
year = {2026}
}
备注
Accepted by ICML 2026