从像素到策略:为内容感知布局设计强化空间推理
人工智能
2026-02-19 v2 计算与语言
图形学
摘要
我们提出了 LaySPA—a 个强化学习框架,为大型语言模型(LLM)提供显式且可解释的内容感知图形布局设计的空间推理能力。LaySPA 解决了两个关键挑战:LLM 的空间推理有限,以及设计决策缺乏透明度。我们不在像素层面操作,而是将布局设计问题形式化为结构化文本空间环境上的策略学习问题,该环境显式编码画布几何、元素属性及元素间关系。LaySPA 生成双层输出,包括可解释的推理轨迹和结构化布局规范,实现布局设计的透明且可控决策。通过多目标空间批判优化布局设计策略,将布局质量分解为几何有效性、关系一致性和审美一致性,并利用相对组优化进行训练,以稳定开放设计空间中的学习。实验表明,LaySPA 在结构有效性和视觉质量方面均取得改进,超越了更大的专有 LLM,性能与专业化的 SOTA 布局生成器相当,同时需要更少的标注样本和更低的延迟。
引用
@article{arxiv.2602.13912,
title = {From Pixels to Policies: Reinforcing Spatial Reasoning in Language Models for Content-Aware Layout Design},
author = {Sha Li and Stefano Petrangeli and Yu Shen and Xiang Chen},
journal= {arXiv preprint arXiv:2602.13912},
year = {2026}
}