中文

DiffInk:面向文本到在线手写生成的字形与风格感知潜在扩散 Transformer

计算机视觉与模式识别 2026-03-03 v4

摘要

深度生成模型推动了文本到在线手写生成(TOHG),旨在条件化文本输入和风格参考合成逼真笔轨。然而大多数现有方法仅关注字符或词级别生成,导致效率低下且缺乏对整体结构的建模。为此,我们提出 DiffInk,首个用于全行手写生成的潜在扩散 Transformer 框架。我们首先引入 InkVAE,一种新型顺序变分自编码器,增强了两种互补潜在空间正则化损失:(1)基于 OCR 的损失确保字形级精度;(2)基于风格分类的损失保留书写风格。这种双重正则化生成语义结构化潜在空间,有效解耦字符内容与作家风格。随后,我们提出 InkDiT,一种新型潜在扩散 Transformer,整合目标文本与参考风格以生成连贯笔轨。实验结果表明,DiffInk 在字形精度与风格保真度方面均优于现有最新专家(SOTA)方法,同时显著提升生成效率。

关键词

引用

@article{arxiv.2509.23624,
  title  = {DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation},
  author = {Wei Pan and Huiguo He and Hiuyi Cheng and Yilin Shi and Lianwen Jin},
  journal= {arXiv preprint arXiv:2509.23624},
  year   = {2026}
}

备注

Accepted by ICLR 2026