中文

米氏-哈蒙斯加Caption游戏:通过去中心化贝叶斯推断融合视觉语言模型知识

计算与语言 2025-04-15 v1 人工智能 计算机视觉与模式识别 多智能体系统

摘要

我们提出了米氏-哈蒙斯加Caption游戏(MHCG),一种通过学习相互之间的知识来融合多个视觉语言模型(VLMs)的方法。虽然现有方法融合多个模型会受到推理成本和架构限制的影响,但MHCG 通过类似语言游戏的过程进行去中心化贝叶斯推断,避免了这些问题。知识融合过程在两个 VLM 代理人之间建立通信,使其轮流描述图像并从彼此学习。我们对两个视觉-语言模型进行了两个图像描述实验,每个模型都在不同数据集上进行预训练。第一个实验表明,MHCG 在无参考评估指标上实现了持续的改进。第二个实验探讨了MHCG如何通过观察生成描述中词汇的出现情况,促进VLMs 类别级词汇的共享。

关键词

引用

@article{arxiv.2504.09620,
  title  = {Metropolis-Hastings Captioning Game: Knowledge Fusion of Vision Language Models via Decentralized Bayesian Inference},
  author = {Yuta Matsui and Ryosuke Yamaki and Ryo Ueda and Seitaro Shinagawa and Tadahiro Taniguchi},
  journal= {arXiv preprint arXiv:2504.09620},
  year   = {2025}
}