中文

基于传统东方山水画的场景深度估计

计算机视觉与模式识别 2024-03-08 v2

摘要

从绘画中进行场景深度估计可以简化 3D 雕塑的创作过程,使视障人士能够通过触觉欣赏绘画。然而,由于东方山水画独特的深度描绘方法和保存状况不佳,测量其图像深度极具挑战性。为解决东方山水画图像的场景深度估计问题,我们提出了一种新颖的框架,该框架包含两步图像到图像翻译方法,并在前端采用基于 CLIP 的图像匹配,以预测与给定东方山水画图像最匹配的真实场景图像。随后,我们对生成的真实场景图像使用预训练的 SOTA 深度估计模型。在第一步中,CycleGAN 将东方山水画图像转换为伪真实场景图像。我们利用 CLIP 以无监督方式将风景照片图像与东方山水画图像进行语义匹配,用于训练 CycleGAN。然后,将伪真实场景图像和东方山水画图像输入 DiffuseIT,在第二步中预测最终的真实场景图像。最后,我们使用预训练的深度估计模型(如 MiDaS)测量生成的真实场景图像的深度。实验结果表明,我们的方法能够很好地预测与东方山水画图像对应的真实场景图像。据我们所知,这是首次尝试测量东方山水画图像深度的研究。我们的研究有望协助视障人士以多样化的方式体验绘画。我们将公开代码和生成的数据集。

关键词

引用

@article{arxiv.2403.03408,
  title  = {Scene Depth Estimation from Traditional Oriental Landscape Paintings},
  author = {Sungho Kang and YeongHyeon Park and Hyunkyu Park and Juneho Yi},
  journal= {arXiv preprint arXiv:2403.03408},
  year   = {2024}
}