面向零样本中文字体生成的结构级解缝扩散模型
计算机视觉与模式识别
2026-02-24 v1 人工智能
摘要
零样本中文字体生成旨在仅使用少量参考图像即可合成目标样式中的新字符。实现准确的内容渲染和可靠的风格迁移需要有效地解缝内容与风格。然而,现有方法仅实现特征级解缝,允许生成器重新缝合这些特征,导致内容变形和风格忠诚度下降。我们提出结构级解缝扩散模型(SLD-Font),从两个独立的通道接收内容和风格信息。使用宋体样式图像作为内容模板,并与带噪 latent 特征拼接作为输入。从目标样式图像中提取的风格特征通过跨注意力集成。此外,我们在像素空间训练背景噪声移除模块,以去除复杂笔画区域中的背景噪声。基于解缝有效性的理论验证,我们引入一种参数高效微调策略,仅更新与风格相关的模块,以便更好地适应新风格,同时避免对参考图像内容的过拟合。我们进一步引入灰度和OCR指标来评估生成字符的内容质量。实验结果表明,SLD-Font 在保持相当于现有领先方法的相当的内容精度的同时,实现了显著提升的风格忠诚度。
引用
@article{arxiv.2602.18874,
title = {Structure-Level Disentangled Diffusion for Few-Shot Chinese Font Generation},
author = {Jie Li and Suorong Yang and Jian Zhao and Furao Shen},
journal= {arXiv preprint arXiv:2602.18874},
year = {2026}
}