中文

多模态提示优化:为何不利用多种模态服务于多模态大语言模型

机器学习 2026-02-20 v2 人工智能 计算与语言

摘要

大型语言模型(LLMs)已取得显著成功,其多模态扩展(MLLMs)进一步解锁了涵盖图像、视频及其他模态的能力。然而,尽管发生了这一转变,旨在减轻手动提示构建负担同时最大化性能的提示优化方法仍局限于文本,最终限制了MLLMs的全部潜力。出于这一空白,我们引入了多模态提示优化这一新问题,将提示优化的先前定义扩展到由文本与非文本提示对定义的多模态空间。为解决这一问题,我们随后提出了多模态提示优化器(MPO),一个统一框架,不仅通过对齐保持更新执行多模态提示的联合优化,还通过利用先前评估作为贝叶斯选择策略中的先验来引导候选提示的选择过程。通过在多种模态上的广泛实验——超越文本,如图像、视频甚至分子——我们证明MPO优于领先的纯文本优化方法,确立了多模态提示优化作为实现MLLMs潜力的关键步骤。

关键词

引用

@article{arxiv.2510.09201,
  title  = {Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs},
  author = {Yumin Choi and Dongki Kim and Jinheon Baek and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2510.09201},
  year   = {2026}
}

备注

ICLR 2026