InkDiffuser:基于可微形态优化的高保真中文书法
计算机视觉与模式识别
2026-05-08 v1
摘要
当前中文书法生成方法存在笔画渲染不佳和墨迹不真实的问题,导致输出在视觉保真度和艺术流畅性方面受限。为此,我们提出InkDiffuser,一个基于扩散模型的中文书法合成框架。为保证高保真渲染,我们引入两个核心贡献:高频增强机制和可微墨结构(DIS)损失,后者显式正则化墨迹形态。灵感来自观察到单个样本中的高频信息通常携带轮廓细节,我们通过显式融合高频表示来增强内容提取,实现更准确的字体结构。此外,我们提出一种可微墨结构损失,将可微形态操作集成到扩散过程中。通过允许模型学习墨迹轨迹结构的显式分解,DIS促进笔画轮廓的细粒度细化,显著提升生成书法的视觉逼真度。在多种书法字体和复杂字符上的大量实验表明,InkDiffuser能够仅通过单个参考字母即可生成具有真实墨迹渲染效果的优异书法字体,并在结构一致性、细节保真度和视觉真实性方面超越现有few-shot字体生成方法。代码地址:https://github.com/JingVIPLab/InkDiffuser。
引用
@article{arxiv.2605.05865,
title = {InkDiffuser: High-Fidelity One-shot Chinese Calligraphy via Differentiable Morphological Optimization},
author = {Kunchong Shi and Jing Zhang},
journal= {arXiv preprint arXiv:2605.05865},
year = {2026}
}
备注
10 pages, 6 figures