MMFactory:面向视觉语言任务的通用解决方案搜索引擎
计算机视觉与模式识别
2024-12-25 v1 人工智能
计算与语言
机器学习
摘要
随着基础模型和视觉语言模型的进步,以及有效的微调技术,大量针对各种视觉任务开发了通用型和专用型模型。尽管这些模型具有良好的灵活性和可访问性,但没有单个模型能够处理潜在用户所构想的所有任务和应用。近期方法,如视觉编程和集成工具的多模态大语言模型,旨在通过程序综合来解决复杂视觉任务。然而,这些方法忽略了用户约束(如性能/计算需求),产生的测试时特定解难以部署,且有时需要超出新手用户能力的低级指令。为此,我们引入了MMFactory,一个包含模型和指标路由组件的通用框架,充当各种可用模型之间的解决方案搜索引擎。基于任务描述和少量输入输出样本对(可选地)资源和/或性能约束,MMFactory可以通过实例化和组合其模型库中的视觉语言工具,建议一组多样化的程序化解决方案。除了这些解决方案的合成,MMFactory还提出度量和基准测试性能/资源特征,允许用户挑选满足其独特设计约束的解决方案。从技术角度,我们还引入了基于委员会的解决方案提议者,利用多智能体LLM对话生成可执行、多样、通用且稳健的解决方案。实验结果表明,MMFactory通过交付量身定制于用户问题规范的领先解决方案,优于现有方法。项目页面可访问于 https://davidhalladay.github.io/mmfactory_demo。
引用
@article{arxiv.2412.18072,
title = {MMFactory: A Universal Solution Search Engine for Vision-Language Tasks},
author = {Wan-Cyuan Fan and Tanzila Rahman and Leonid Sigal},
journal= {arXiv preprint arXiv:2412.18072},
year = {2024}
}