通过多智能体协作将大语言模型扩展到新模态
计算与语言
2025-11-25 v1 人工智能
机器学习
摘要
大型语言模型(LLMs)在具有挑战性的、知识密集型推理任务中已显示出惊人的能力。然而,扩展LLMs以感知和推理新的模态(例如视觉),通常需要开发大规模视觉语言模型(VLMs),其以LLMs作为 backbone。较小的VLMs更高效且更具可适应性,但往往缺乏主流LLMs的广泛知识和推理能力。在本工作中,我们提出BeMyEyes,一个模块化的、面向多模态推理的框架,通过在对话中协调高效灵活的VLMs作为感知器与强大LLMs作为推理器,来扩展LLMs的多模态推理能力。我们然后引入一个数据合成和监督式微调管道,以训练感知器智能体有效地与推理器智能体协作。通过将感知器和推理器的互补优势相结合,BeMyEyes避免了训练大规模多模态模型的需求,保留了LLMs的泛化和推理能力,并允许灵活地扩展到新的领域和模态。实验表明,我们的框架为LLMs提供了多模态推理能力,使能够轻量且完全开源的解决方案,即将仅文本的 DeepSeek-R1 与 Qwen2.5-VL-7B 感知器相结合,能够在广泛的知识密集型多模态任务上超越GPT-4o等大型专有VLMs。这些结果表明了我们多智能体方法在构建未来多模态推理系统方面的有效性、模块性和可扩展性。
引用
@article{arxiv.2511.19417,
title = {Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration},
author = {James Y. Huang and Sheng Zhang and Qianchu Liu and Guanghui Qin and Tinghui Zhu and Tristan Naumann and Muhao Chen and Hoifung Poon},
journal= {arXiv preprint arXiv:2511.19417},
year = {2025}
}