中文

超越文本:利用MultiAPI基准揭示大语言模型的多模态能力

计算与语言 2023-11-23 v1

摘要

ChatGPT等大语言模型(LLM)的激增显著推进了语言理解与生成,影响了广泛的应用。然而,这些模型主要在基于文本的任务上表现出色,忽视了现实世界多模态信息的复杂性。本研究引入了MultiAPI,一个开创性的综合性大规模API基准数据集,旨在扩展LLM在多模态语境中的能力。MultiAPI通过ChatGPT协作开发,由235个不同的API调用和2,038个上下文提示组成,为评估工具增强型LLM处理多模态任务提供了独特平台。通过综合实验,我们的发现表明,尽管LLM在API调用决策方面表现出能力,但在领域识别、函数选择和参数生成方面面临挑战。此外,我们惊讶地注意到辅助上下文实际上会损害性能。深入的错误分析为应对这些挑战的新范式铺平了道路,暗示了未来LLM研究的潜在方向。

关键词

引用

@article{arxiv.2311.13053,
  title  = {Beyond Text: Unveiling Multimodal Proficiency of Large Language Models with MultiAPI Benchmark},
  author = {Xiao Liu and Jianfeng Lin and Jiawei Zhang},
  journal= {arXiv preprint arXiv:2311.13053},
  year   = {2023}
}

备注

Work in Progress