中文

AeSlides:通过可验证奖励激励 LLM 基于布局的幻灯片生成中的美学

计算机视觉与模式识别 2026-04-28 v1 计算与语言 多媒体

摘要

大型语言模型(LLM)在 agentic 任务中展现出强大的潜力,尤其在幻灯片生成方面。然而,幻灯片生成面临根本性挑战:生成过程以文本为中心,而其质量由视觉美学决定。这一模态差距导致当前模型经常生成布局不够美观的幻灯片。现有解决方案通常依赖重型视觉反思,推理成本高且收益有限;或依赖大规模数据集进行微调,仍提供弱且间接的美学监督。相较之下,明确使用美学原则作为监督仍未被探索。本工作提出 AeSlides,一个针对幻灯片生成中的美学布局 supervision 设计的强化学习框架。我们构建了一套精心设计的可验证指标,用于量化幻灯片布局质量,准确、高效且低成本地捕获关键布局问题。依据这些可验证指标,我们开发了基于 GRPO 的强化学习方法,直接优化幻灯片生成模型以实现美观一致的布局。仅使用 5K 条训练提示即可在 GLM-4.7-Flash 上提升幻灯片比例合规率从 36% 至 85%,同时将空白区域减少 44%,元素碰撞降低 43%,视觉不平衡降低 28%。人类评估进一步显示整体质量显著提升,得分从 3.31 提升至 3.56(提升 7.6%),超越基于模型的奖励优化和基于反思的 agentic 方法,甚至略胜 Claude-Sonnet-4.5。这些结果表明,可验证的美学范式为将幻灯片生成对齐人类美学偏好提供了高效且可扩展的方法。我们的仓库已公开于 https://github.com/ympan0508/aeslides。

关键词

引用

@article{arxiv.2604.22840,
  title  = {AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards},
  author = {Yiming Pan and Chengwei Hu and Xuancheng Huang and Can Huang and Mingming Zhao and Yuean Bi and Xiaohan Zhang and Aohan Zeng and Linmei Hu},
  journal= {arXiv preprint arXiv:2604.22840},
  year   = {2026}
}

备注

21 pages, 25 figures, 9 tables