中文

AGTGAN:用于摄影古文字生成的非配对图像翻译

计算机视觉与模式识别 2023-03-14 v1 人工智能

摘要

古文字研究对考古学和语文学具有重要价值。其关键素材形式是摄影文字,但人工摄影文字识别极为耗时且依赖专业知识。因此,自动分类备受期待。然而,由于缺乏标注数据,当前性能受限。数据生成是应对数据稀缺的一种廉价而有用的方案。尽管如此,摄影古文字多样的字形与复杂的背景纹理使得生成任务困难,导致现有方法结果不尽如人意。本文中,我们提出一种称为 AGTGAN 的无监督生成对抗网络。通过显式的全局与局部字形风格建模,继以笔画感知的纹理迁移,以及一种关联对抗学习机制,我们的方法能够生成具有多样字形和真实纹理的文字。我们在摄影古文字数据集(如 OBC306 和 CSDD)上评估了我们的方法。我们的方法在各项指标上优于最先进的方法,且在生成样本的多样性和真实性方面表现更佳。利用我们生成的图像,在最大的摄影甲骨文数据集上的实验表明,我们的方法能使分类准确率显著提升,最高达 16.34%。

关键词

引用

@article{arxiv.2303.07012,
  title  = {AGTGAN: Unpaired Image Translation for Photographic Ancient Character Generation},
  author = {Hongxiang Huang and Daihui Yang and Gang Dai and Zhen Han and Yuyi Wang and Kin-Man Lam and Fan Yang and Shuangping Huang and Yongge Liu and Mengchao He},
  journal= {arXiv preprint arXiv:2303.07012},
  year   = {2023}
}