中文

ORIDa:面向对象的真实世界图像组合数据集

计算机视觉与模式识别 2025-06-11 v1

摘要

物体组合,即将物体放置并协调于多样化视觉场景图像中的任务,随着生成模型的兴起已成为计算机视觉中的重要任务。然而,现有数据集缺乏全面探索真实场景所需的多样性和规模。我们提出了 ORIDa(面向对象的真实世界图像组合数据集),一个大规模、真实拍摄的包含超过 30,000 张图像的数据集,涵盖 200 种独特物体,每种物体在不同位置和场景中出现。ORIDa 包含两种类型的数据:事实-反事实集和纯事实场景。事实-反事实集由四张展示物体在场景中不同位置的事实图像和一张不包含该物体的反事实(或背景)图像组成,每个场景共五张图像。纯事实场景包含一张在特定语境中包含物体的单张图像,从而扩展了环境的多样性。据我们所知,ORIDa 是首个具有如此规模和复杂度的真实世界图像组合公开数据集。广泛的分析和实验凸显了 ORIDa 作为推进物体组合进一步研究资源的价值。

关键词

引用

@article{arxiv.2506.08964,
  title  = {ORIDa: Object-centric Real-world Image Composition Dataset},
  author = {Jinwoo Kim and Sangmin Han and Jinho Jeong and Jiwoo Choi and Dongyoung Kim and Seon Joo Kim},
  journal= {arXiv preprint arXiv:2506.08964},
  year   = {2025}
}

备注

Accepted at CVPR 2025