中文

REALEDIT:作为大规模图像变换经验数据集的Reddit编辑

计算机视觉与模式识别 2025-04-30 v2 人工智能 计算与语言 机器学习

摘要

现有的图像编辑模型难以满足现实世界的需求。尽管在学术基准测试中表现出色,但它们尚未被广泛用于满足真实用户需求。驱动这些模型的数据集使用人工编辑,缺乏解决用户请求真正多样性所需的规模和生态效度。我们引入了REALEDIT,一个源自Reddit的大规模图像编辑数据集,包含真实的用户请求和人工编辑。REALEDIT包含一个包含9300个示例的测试集,用于评估模型在真实用户请求上的表现。我们的结果表明,现有模型在这些任务上表现不佳,突显了对真实训练数据的需求。为解决此问题,我们引入了48K训练样本并训练了我们的REALEDIT模型,取得了显著提升——在人类评判中比竞争对手高出多达165个Elo分,在自动VIEScore指标上相对提升了92%。我们将模型部署到Reddit上,在新的请求上进行测试,并收到了积极反馈。除了图像编辑,我们还通过与一个深度伪造检测非营利组织合作,探索了REALEDIT在检测编辑图像方面的潜力。在REALEDIT数据上微调他们的模型,将其F1分数提高了14个百分点,突显了该数据集在广泛应用中的价值。

关键词

引用

@article{arxiv.2502.03629,
  title  = {REALEDIT: Reddit Edits As a Large-scale Empirical Dataset for Image Transformations},
  author = {Peter Sushko and Ayana Bharadwaj and Zhi Yang Lim and Vasily Ilin and Ben Caffee and Dongping Chen and Mohammadreza Salehi and Cheng-Yu Hsieh and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2502.03629},
  year   = {2025}
}

备注

Published at CVPR 2025