中文

探究与增强全模态大语言模型中的视觉-音频能力

计算机视觉与模式识别 2025-10-20 v3 机器学习

摘要

全模态大语言模型(OLLMs)在整合视觉与文本方面已取得显著进展,但在整合视觉与音频方面仍存在困难,在处理音频查询时往往表现出次优性能。这种差异主要源于训练过程中视觉与音频模态之间的对齐不足,导致使用音频查询时对视觉信息的关注不够。为缓解这一问题,我们提出了一种自知识蒸馏(Self-KD)训练方法,其中 OLLM 的视觉-文本组件作为教师,视觉-音频组件作为学生。这使模型能够以类似于处理文本的方式处理音频。实验结果表明,Self-KD 是一种有效的方法,可通过从视觉-文本组件学习来增强 OLLM 的视觉-音频能力,进而改善音频与图像之间的交互,并在多模态任务上取得更好的性能。

关键词

引用

@article{arxiv.2503.00059,
  title  = {Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models},
  author = {Rui Hu and Delai Qiu and Shuyu Wei and Jiaming Zhang and Yining Wang and Shengping Liu and Jitao Sang},
  journal= {arXiv preprint arXiv:2503.00059},
  year   = {2025}
}

备注

Accepted to ACL 2025 Findings