面向资源高效推理的基础模型程序
图像与视频处理
2025-04-17 v2
摘要
大型语言和视觉模型的推理时资源成本在生产部署中日益增加。我们提出使用基础模型程序(foundation model programs),即能够以不同资源成本和性能调用基础模型的程序,以解决这一问题。具体而言,我们提出了一种方法,将任务转换为程序,然后学习一种资源分配策略,该策略在每个输入上选择每个程序模块的“后端”。该策略使用较小、较便宜的后端来处理较简单的子任务,同时允许更复杂的子任务利用更大、更强大的模型。我们在两个新的“流式”视觉问答任务上对该方法进行了评估,这些任务中系统对一系列输入回答问题,随后接收到每个答案的 ground-truth 反馈。与单一的多模态模型相比,我们的实现实现了最高 98% 的资源节省,同时保持最小的精度损失,展示了其在可扩展且资源高效的多模态推理方面的潜力。
引用
@article{arxiv.2504.07246,
title = {Dual Deep Learning Approach for Non-invasive Renal Tumour Subtyping with VERDICT-MRI},
author = {Snigdha Sen and Lorna Smith and Lucy Caselton and Joey Clemente and Maxine Tran and Shonit Punwani and David Atkinson and Richard L Hesketh and Eleftheria Panagiotaki},
journal= {arXiv preprint arXiv:2504.07246},
year = {2025}
}
备注
19 pages, 9 figures