面向可编辑多层文档的文本条件背景生成
计算机视觉与模式识别
2025-12-22 v1
摘要
我们提出了一个面向文档的背景生成框架,支持多页面编辑和主题连续性。为确保文本区域可读性,我们采用一种潜在遮蔽表述,对扩散空间中的更新进行柔和衰减,灵感来自物理中的光滑屏障函数和数值优化。在此基础上,我们引入了自动可读性优化(ARO),后者自动在文本区域后方放置半透明圆角 backing 形状。ARO 确定满足感知对比标准(WCAG 2.2)所需的最小不透明度,以确保可读性,同时保持审美和谐,无需人工干预。通过摘要-指令过程维持多页面一致性,其中每个页面被压缩为紧凑表示,递归指导后续生成。该设计反映了人类通过保留先前上下文来构建连续性的方式,确保视觉图案在整个文档中演化得体。我们的 метод进一步将文档视为文本、图形和背景被保留或单独再生成的结构组成,从而允许在不损害可读性的前提下进行针对性背景编辑。最后,用户提供的提示允许对颜色和纹理进行风格化调整,在自动一致性与灵活定制之间取得平衡。我们的训练自由框架产生视觉连贯、可读且主题一致的文档,桥接了生成模型与自然设计工作流程。
引用
@article{arxiv.2512.17151,
title = {Text-Conditioned Background Generation for Editable Multi-Layer Documents},
author = {Taewon Kang and Joseph K J and Chris Tensmeyer and Jihyung Kil and Wanrong Zhu and Ming C. Lin and Vlad I. Morariu},
journal= {arXiv preprint arXiv:2512.17151},
year = {2025}
}