中文

Diff-Oracle:利用可控扩散模型解读甲骨文

计算机视觉与模式识别 2024-07-09 v2

摘要

解读甲骨文在中国考古学和文字学中扮演着重要角色。然而,由于甲骨文字符图像的稀缺性,这一领域仍面临重大挑战。为了克服这一问题,我们提出了 Diff-Oracle,这是一种基于扩散模型的新方法,用于生成多样化的可控甲骨文字符。与主要基于文本提示的传统扩散模型不同,Diff-Oracle Incorporates 一个风格编码器,利用风格参考图像来控制生成风格。该编码器从现有甲骨文字符图像中提取风格提示,并通过预训练的语言 - 视觉模型将风格细节转换为文本嵌入格式。另一方面,Diff-Oracle 集成了一个内容编码器,以从内容参考图像中捕获特定的内容细节,确保生成的字符准确代表预期的字形。为了有效训练 Diff-Oracle,我们通过图像到图像翻译模型预先生成了像素级配对的甲骨文字符图像(即风格和内容图像)。我们在 Oracle-241 和 OBC306 数据集上进行了广泛的定性和定量实验。虽然在图像生成方面显著超越了现有的生成方法,但 Diff-Oracle 还极大地惠及了下游的甲骨文字符识别任务,以大幅优势超越了所有现有的 SOTAs。特别是在具有挑战性的 OBC306 数据集上,Diff-Oracle 在零样本设置下带来了 7.70% 的准确率提升,并能够以 84.62% 的准确率识别未见过的甲骨文字符图像,为解读甲骨文树立了新的基准。

关键词

引用

@article{arxiv.2312.13631,
  title  = {Diff-Oracle: Deciphering Oracle Bone Scripts with Controllable Diffusion Model},
  author = {Jing Li and Qiu-Feng Wang and Siyuan Wang and Rui Zhang and Kaizhu Huang and Erik Cambria},
  journal= {arXiv preprint arXiv:2312.13631},
  year   = {2024}
}