中文

PPTC 基准:评估大语言模型完成 PowerPoint 任务的能力

计算与语言 2023-11-08 v2

摘要

近期对大语言模型(LLMs)的评估集中于测试其用于基础自然语言任务的零样本/少样本能力,以及将指令转化为工具 API 的能力。然而,利用复杂工具在复杂多模态环境中完成多轮、多模态指令的 LLM 评估尚未被研究。为填补此空白,我们引入 PowerPoint 任务完成(PPTC)基准,以评估 LLM 基于用户指令创建和编辑 PPT 文件的能力。它包含 279 个多轮会话,覆盖多样主题及涉及多模态操作的数百条指令。我们还提出 PPTX-Match 评估系统,基于预测文件而非标注 API 序列评估 LLM 是否完成指令,从而支持多种 LLM 生成的 API 序列。我们测评了 3 个闭源 LLM 与 6 个开源 LLM。结果显示 GPT-4 在单轮对话测试中准确率 75.1% 优于其他 LLM,但在完成整个会话上面临挑战,会话准确率仅 6%。我们在基准中发现三类主要错误原因:多轮会话中的错误累积、长 PPT 模板处理、以及多模态感知。这些对未来 LLM 与智能体系统构成重大挑战。我们在 \url{https://github.com/gydpku/PPTC} 发布 PPTC 的数据、代码与评估系统。

关键词

引用

@article{arxiv.2311.01767,
  title  = {PPTC Benchmark: Evaluating Large Language Models for PowerPoint Task Completion},
  author = {Yiduo Guo and Zekai Zhang and Yaobo Liang and Dongyan Zhao and Nan Duan},
  journal= {arXiv preprint arXiv:2311.01767},
  year   = {2023}
}

备注

LLM evaluation, PPT task completion