中文

利用扩散视觉变换器解决掩码拼图问题

计算机视觉与模式识别 2024-04-12 v1

摘要

解决图像和视频拼图问题,涉及从无序序列中重新排列图像碎片或视频帧以恢复有意义的图像和视频序列。现有方法通常依赖于判别模型,预测拼图元素的绝对位置或对原始数据应用的排列操作。然而,这些方法在解决包含大量元素的拼图时存在局限性。本文提出JPDVT,一种利用扩散变换器解决该问题的新方法。具体而言,我们基于图像块或视频帧的视觉内容生成其位置信息,然后利用该信息准确组装拼图块,即使存在缺失块。我们的方法在多个数据集上达到了最先进性能。

关键词

引用

@article{arxiv.2404.07292,
  title  = {Solving Masked Jigsaw Puzzles with Diffusion Vision Transformers},
  author = {Jinyang Liu and Wondmgezahu Teshome and Sandesh Ghimire and Mario Sznaier and Octavia Camps},
  journal= {arXiv preprint arXiv:2404.07292},
  year   = {2024}
}

备注

8 pages, 7 figures