中文

ScriptViT:基于视觉Transformer的个性化手写体生成

计算机视觉与模式识别 2025-11-25 v1 人工智能 机器学习

摘要

styled handwriting generation既旨合成逼真且符合特定书写者风格的手写文本。虽然近期涉及GAN、transformer和扩散模型的方法已取得进展,但这些方法往往难以捕捉书写者特定属性的完整范围,尤其是跨越长程空间依赖性的全局风格模式。因此,在保持生成文本准确性的前提下,捕捉诸如一致倾斜角、曲线或笔画压力等细微书写者特征仍是一个开放问题。本文提出了一个统一框架以解决上述局限性。我们引入了基于视觉Transformer的风格编码器,从多个参考图像中学习全局风格模式,使模型能够更好地代表手写体的长程结构特征。随后,我们通过跨注意力机制将这些风格线索与目标文本集成,使系统能够生成更忠实于预期风格的手写图像。为使过程更具可解释性,我们利用显著笔画注意力分析(SSAA),揭示模型在风格迁移期间关注的笔画级别特征。这些组件共同导致了更具风格一致性且更易于理解和分析的手写合成。

关键词

引用

@article{arxiv.2511.18307,
  title  = {ScriptViT: Vision Transformer-Based Personalized Handwriting Generation},
  author = {Sajjan Acharya and Rajendra Baskota},
  journal= {arXiv preprint arXiv:2511.18307},
  year   = {2025}
}