中文

PPTC-R 基准:面向评估大语言模型完成 PowerPoint 任务的鲁棒性

计算与语言 2024-03-07 v1

摘要

用户对大语言模型 (LLMs) 完成指令的依赖日益增长,这就要求全面理解其在现实情境中完成复杂任务的鲁棒性。为满足这一关键需求,我们提出了 PowerPoint 任务完成鲁棒性基准 (PPTC-R),以衡量 LLMs 对用户 PPT 任务指令和软件版本的鲁棒性。具体而言,我们通过在句子、语义和多语言层面攻击用户指令来构建对抗性用户指令。为了评估语言模型对软件版本的鲁棒性,我们改变提供的 API 数量以模拟最新版本和早期版本的设置。随后,我们使用包含这些鲁棒性设置的基准测试了 3 个闭源和 4 个开源 LLMs,旨在评估偏差如何影响 LLMs 完成任务的 API 调用。我们发现 GPT-4 在我们的基准测试中表现出最高的性能和强大的鲁棒性,特别是在版本更新和多语言设置方面。然而,我们发现当所有 LLMs 同时面临多重挑战(例如多轮对话)时,它们会失去鲁棒性,导致性能显著下降。我们进一步分析了 LLMs 在我们基准测试中的鲁棒性行为和错误原因,为研究人员理解 LLM 在任务完成中的鲁棒性并开发更鲁棒的 LLMs 和智能体提供了有价值的见解。代码和数据已发布在 \url{https://github.com/ZekaiGalaxy/PPTCR}。

关键词

引用

@article{arxiv.2403.03788,
  title  = {PPTC-R benchmark: Towards Evaluating the Robustness of Large Language Models for PowerPoint Task Completion},
  author = {Zekai Zhang and Yiduo Guo and Yaobo Liang and Dongyan Zhao and Nan Duan},
  journal= {arXiv preprint arXiv:2403.03788},
  year   = {2024}
}

备注

LLM evaluation, Multi-turn, Multi-language, Multi-modal benchmark