PPTBench:面向PowerPoint布局与设计理解的大型语言模型全面评估
计算机视觉与模式识别
2025-12-03 v1
摘要
PowerPoint演示将丰富的文本内容与结构化的视觉布局相结合,使其成为评估现代多模态大语言模型(MLLMs)语义推理和布局理解能力的自然试验场。然而,现有基准仅关注狭窄子任务,忽视了以布局为核心的挑战,这些挑战是实际幻灯片创建和编辑的核心。为弥合这一差距,我们引入PPTBench,一个用于评估大语言模型在PowerPoint相关任务上的综合性多模态基准。基于958个PPTX文件的多样化来源,PPTBench在四个类别中评估模型,涵盖4,439个样本,包括检测、理解、修改和生成。我们的实验显示,当前MLLMs在语义理解与视觉布局推理之间存在显著差距:模型能够解释幻灯片内容,但无法生成连贯的空间布局。消融和进一步分析表明,当前MLLMs在将视觉线索与JSON格式的布局结构相结合方面困难,且无法将视觉信息整合到其API规划能力中。案例研究直观地暴露了系统性布局错误,如错位和元素重叠。这些发现为在PPT场景下评估VLLMs提供了新视角,突显了面向视觉-结构推理和连贯幻灯片生成的挑战及未来研究方向。所有数据集和代码均已完全公开,以支持可重复性和未来研究。
关键词
引用
@article{arxiv.2512.02624,
title = {PPTBench: Towards Holistic Evaluation of Large Language Models for PowerPoint Layout and Design Understanding},
author = {Zheng Huang and Xukai Liu and Tianyu Hu and Kai Zhang and Ye Liu},
journal= {arXiv preprint arXiv:2512.02624},
year = {2025}
}