中文

探测音视频大语言模型中的跨模态信息枢纽

人工智能 2026-05-13 v2 音频与语音处理

摘要

音视频大语言模型(AVLLMs)最近涌现出一种强大的架构,能够联合推理音频、视觉和文本三种模态。在 AVLLMs 中,音频与视频模态之间的双向交互引入了复杂的处理动力学,亟需深入理解其内部机制。然而,与广泛研究的文本-only 或大型视觉语言模型不同,AVLLMs 的内部工作原理仍鲜有探索。本文聚焦于 AVLLMs 中音频与视觉模态之间的跨模态信息流,研究信息从一种模态编码到另一种模态的 token 表示中的位置。通过对多种近期 AVLLMs 的分析,我们发现了两个普遍发现:首先,AVLLMs 主要在 sink token 中编码集成的音视频信息;其次,sink token 并不均匀地持有跨模态信息。相反,sink token 中一小部分特殊子集(我们称之为跨模态 sink token)专门用于存储此类信息。基于这些发现,我们进一步提出一种简单的、无需训练的幻觉缓解方法,通过鼓励依赖跨模态 sink token 中集成的跨模态信息。我们的代码已公开于 https://github.com/kaistmm/crossmodal-hub。

关键词

引用

@article{arxiv.2605.10815,
  title  = {Probing Cross-modal Information Hubs in Audio-Visual LLMs},
  author = {Jihoo Jung and Chaeyoung Jung and Ji-Hoon Kim and Joon Son Chung},
  journal= {arXiv preprint arXiv:2605.10815},
  year   = {2026}
}

备注

Accepted by ICML 2026