超越文本:利用MultiAPI基准揭示大语言模型的多模态能力
计算与语言
2023-11-23 v1
摘要
ChatGPT等大语言模型(LLM)的激增显著推进了语言理解与生成,影响了广泛的应用。然而,这些模型主要在基于文本的任务上表现出色,忽视了现实世界多模态信息的复杂性。本研究引入了MultiAPI,一个开创性的综合性大规模API基准数据集,旨在扩展LLM在多模态语境中的能力。MultiAPI通过ChatGPT协作开发,由235个不同的API调用和2,038个上下文提示组成,为评估工具增强型LLM处理多模态任务提供了独特平台。通过综合实验,我们的发现表明,尽管LLM在API调用决策方面表现出能力,但在领域识别、函数选择和参数生成方面面临挑战。此外,我们惊讶地注意到辅助上下文实际上会损害性能。深入的错误分析为应对这些挑战的新范式铺平了道路,暗示了未来LLM研究的潜在方向。
引用
@article{arxiv.2311.13053,
title = {Beyond Text: Unveiling Multimodal Proficiency of Large Language Models with MultiAPI Benchmark},
author = {Xiao Liu and Jianfeng Lin and Jiawei Zhang},
journal= {arXiv preprint arXiv:2311.13053},
year = {2023}
}
备注
Work in Progress