中文

Paper2Poster:基于科学论文的多模态海报自动化生成

计算机视觉与模式识别 2025-10-31 v2 人工智能 计算与语言 多智能体系统

摘要

学术海报生成是科学传播中一项关键且具挑战性的任务,需要将长上下文交错文档压缩为单一且视觉连贯的页面。为应对这一挑战,我们引入了首个面向海报生成的基准测试与指标套件,将近期会议论文与作者设计的海报配对,并从以下维度评估输出:(i) 视觉质量——与人类海报的语义对齐,(ii) 文本连贯性——语言流畅度,(iii) 综合评估——由 VLM-as-judge 评分的六项细粒度美学与信息标准,以及尤为重要的 (iv) PaperQuiz——通过 VLM 回答生成的测验来衡量海报传达论文核心内容的能力。基于该基准,我们提出了 PosterAgent,一种自上而下、视觉在环的多智能体流水线: Parser 将论文提炼为结构化素材库;Planner 将文本-视觉对齐为保留阅读顺序与空间平衡的二叉树布局;Painter-Commenter 循环通过执行渲染代码并利用 VLM 反馈来优化每个面板,以消除溢出并确保对齐。在综合评估中,我们发现 GPT-4o 的输出尽管乍看之下具有视觉吸引力,但常表现出文本噪声且 PaperQuiz 得分较低;我们还发现读者参与度是主要的美学瓶颈,因为人类设计的海报在很大程度上依赖视觉语义来传达含义。我们的完全开源变体(例如基于 Qwen-2.5 系列)在几乎所有指标上均优于现有的 4o 驱动多智能体系统,同时使用的 token 减少了 87%。它将一篇 22 页的论文转化为最终定稿且可编辑的 .pptx 海报——总成本仅 0.005 美元。这些发现为下一代全自动海报生成模型指明了清晰的方向。代码和数据集可在 https://github.com/Paper2Poster/Paper2Poster 获取。

关键词

引用

@article{arxiv.2505.21497,
  title  = {Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers},
  author = {Wei Pang and Kevin Qinghong Lin and Xiangru Jian and Xi He and Philip Torr},
  journal= {arXiv preprint arXiv:2505.21497},
  year   = {2025}
}

备注

Project Page: https://github.com/Paper2Poster/Paper2Poster