中文

用于图形设计补全的多模态标记文档模型

计算机视觉与模式识别 2025-12-05 v2 人工智能 多媒体

摘要

我们引入了 MarkupDM,一种多模态标记文档模型,将图形设计表示为由标记语言和图像组成的交错多模态文档。与依赖逐元素属性网格表示的现有整体方法不同,我们的表示可以容纳可变长度元素、类型依赖属性和文本内容。受代码生成中中间填充训练的启发,我们训练模型根据周围上下文补全设计文档的缺失部分,使其能够以统一的方式处理各种设计任务。我们的模型还支持图像生成,通过具有图像透明度支持的专用分词器预测离散图像 token。我们在属性值、图像和文本补全三个任务上评估了 MarkupDM,并证明它可以产生与给定上下文一致的合理设计。为了进一步说明我们方法的灵活性,我们在一个新的指令引导设计补全任务上评估了该方法,其中经过指令微调的 MarkupDM 与 SOTA 图像编辑模型相比表现良好,特别是在文本补全方面。这些发现表明,采用我们文档表示的多模态语言模型可以作为广泛设计自动化的通用基础。

关键词

引用

@article{arxiv.2409.19051,
  title  = {Multimodal Markup Document Models for Graphic Design Completion},
  author = {Kotaro Kikuchi and Ukyo Honda and Naoto Inoue and Mayu Otani and Edgar Simo-Serra and Kota Yamaguchi},
  journal= {arXiv preprint arXiv:2409.19051},
  year   = {2025}
}

备注

Accepted by ACM Multimedia 2025, Project page: https://cyberagentailab.github.io/MarkupDM/