中文

图像在先还是文本在先?大语言模型提示与推理任务中模态序列的优化

人工智能 2024-10-07 v1

摘要

本文考察了图像和文本在多模态提示中出现的顺序如何影响大语言模型(LLM)的推理性能。我们对三家商业 LLM 进行了实证评估。我们的结果表明,模态呈现顺序在不同任务中的影响程度因任务复杂度而异。对于涉及单张图像的简单任务,模态顺序对准确性有明确影响。然而,在涉及多张图像和复杂推理步骤的更复杂任务中,顺序的影响力减弱,这可能源于任务对认知需求的增加。我们的发现也突显了问题/提示结构的重要性。在嵌套和多步骤推理任务中,模态顺序在塑造模型性能方面发挥关键作用。虽然 LLM 在推理的初始阶段表现出色,但在重新整合早期信息方面仍感困难,这凸显了 Transformer 架构在多跳推理中的挑战。这表明,将模态的序列与推理步骤的逻辑流程一致比模态顺序本身更为关键。这些见解为改进多模态提示设计提供了有价值的建议,具有更广泛的应用前景,如教育、医学成像和跨模态学习等领域。

关键词

引用

@article{arxiv.2410.03062,
  title  = {Image First or Text First? Optimising the Sequencing of Modalities in Large Language Model Prompting and Reasoning Tasks},
  author = {Grant Wardle and Teo Susnjak},
  journal= {arXiv preprint arXiv:2410.03062},
  year   = {2024}
}