通过多模态表征间循环实现字体补全与编辑
计算机视觉与模式识别
2021-08-31 v1
摘要
从一到数个参考字形生成风格一致的字体字形(即字体补全)是字体设计中的一项重要任务。由于该问题比通用图像风格迁移任务定义更明确,因而受到了视觉与机器学习领域的共同关注。现有方法将此问题作为直接的图像到图像翻译任务处理。本工作中,我们创新性地探索将字体字形作为二维图形对象生成,并以图作为中间表征,从而能捕捉字体风格更内在的图形属性。具体而言,我们构建了一个跨模态循环的图像到图像模型结构,在图像编码器与图像渲染器之间加入图构造器。该新颖的图构造器将字形的潜码映射至符合专家知识的图表征,其训练用于辅助翻译任务。我们的模型在字形补全上生成了优于图像到图像基线及先前最优方法的结果。此外,模型输出的图表征也为用户进行局部编辑与操控提供了直观接口。我们提出的跨模态循环表征学习有望应用于具有来自不同数据模态先验知识的其他领域。我们的代码见 https://github.com/VITA-Group/Font_Completion_Graph。
引用
@article{arxiv.2108.12965,
title = {Font Completion and Manipulation by Cycling Between Multi-Modality Representations},
author = {Ye Yuan and Wuyang Chen and Zhaowen Wang and Matthew Fisher and Zhifei Zhang and Zhangyang Wang and Hailin Jin},
journal= {arXiv preprint arXiv:2108.12965},
year = {2021}
}
备注
submitted to IEEE Transactions on Multimedia (TMM)