中文

UniPPTBench:面向多样化输入设置的演示文稿生成统一基准

计算机视觉与模式识别 2026-05-19 v1

摘要

现有工作通常侧重于在孤立的输入设置下生成演示文稿,而真实世界的用例跨越多种场景,包括模糊的用户提示、长文档、多模态素材和多个异构来源。此外,当前的评估通常缺乏针对特定场景的能力。它们主要依赖于通用的演示文稿质量标准,如视觉吸引力、布局质量和整体连贯性,但未能评估不同输入设置所需的核心能力,包括有依据的压缩、视觉-文本对齐和跨源综合。因此,该领域缺乏一个统一的基准和场景感知的评估框架,以忠实地诊断跨不同真实世界设置的演示文稿生成系统。我们提出了 UniPPTBench,一个跨四种代表性输入设置的演示文稿生成统一基准:模糊提示、长文档、多模态文档和多源生成。我们进一步引入了 UniPPTEval,一个场景感知的评估协议,它结合了用于跨设置比较的共享指标和为每个设置的核心需求量身定制的特定场景指标。我们还提供了透明的参考基线以支持可复现的比较。在 UniPPTBench 上的实验揭示了跨设置的性能差异以及在内容基础、多模态整合和跨源综合中反复出现的失败模式。特别是,在通用演示文稿质量指标上的强劲表现并不一定意味着在有依据的场景中也能很好地完成任务。UniPPTBench 和 UniPPTEval 共同为评估跨不同真实世界场景的演示文稿生成提供了忠实且具有诊断性的基础。代码和数据将公开发布。

关键词

引用

@article{arxiv.2605.17356,
  title  = {UniPPTBench: A Unified Benchmark for Presentation Generation Across Diverse Input Settings},
  author = {Bo Zhao and Maosheng Pang and Chen Zhang and Huan Yang and Yixin Cao and Wei Ji},
  journal= {arXiv preprint arXiv:2605.17356},
  year   = {2026}
}