MLLM 提示工程的未来是自适应的:面向稳健多模态性能的提示工程方法全面实验评估
人工智能
2025-04-15 v1 计算与语言
新兴技术
摘要
多模态大语言模型(MLLMs)正在改变机器处理和生成类人响应的方式,通过整合多样化的模态如文本、图像和代码。然而,有效发挥其潜能取决于最佳提示工程。我们对七种提示工程方法在 13 个开源 MLLMs 上的应用进行了全面实验评估,这些方法覆盖 24 个任务,包括推理与组合性、多模态理解与对齐、复杂代码生成与执行以及知识检索与集成。我们的做法将模型按参数数量划分为小型(<4B)、中型(4B-10B)和大型(>10B)三个类别,并比较包括零样本、零样本、零样本、链式思维、类比、生成知识和树状思维等提示技术。虽然大型 MLLMs 在结构化任务中表现出色,如在零样本提示下实现最高达 96.88% 的准确率,但所有模型在复杂推理和抽象理解方面都表现不佳,准确率常低于 60%,且出现高幅误报。结构化推理提示常导致小型模型的误报率提高至 75%,并导致大型模型响应时间超过 20 秒,而更简单的提示方法则提供了更简洁高效的输出。没有任何单一的提示方法能够统一优化所有任务类型。相反,结合示例驱动的指导与选择性结构化推理的自适应策略对于增强鲁棒性、效率和事实准确性至关重要。我们的发现为提示工程提供了实用建议,并支持更可靠的 MLLMs 在包括 AI 辅助编码、知识检索和多模态内容理解等应用中的部署。
关键词
引用
@article{arxiv.2504.10179,
title = {The Future of MLLM Prompting is Adaptive: A Comprehensive Experimental Evaluation of Prompt Engineering Methods for Robust Multimodal Performance},
author = {Anwesha Mohanty and Venkatesh Balavadhani Parthasarathy and Arsalan Shahid},
journal= {arXiv preprint arXiv:2504.10179},
year = {2025}
}