中文

理解生成式 AI 在日常图像编辑任务中的能力

计算机视觉与模式识别 2025-05-27 v2 人工智能

摘要

生成式 AI(GenAI)在自动化日常图像编辑任务方面具有巨大的潜力,尤其值得注意的是自 2025 年 3 月 25 日发布 GPT-4o 后。然而,人们最常希望编辑的是什么主题?他们想要执行哪些类型的编辑操作(例如,删除或风格化主题)?人们更倾向于选择具有可预测结果的精确编辑,还是高度创造性的编辑?通过理解真实世界请求的特征及对应由自由职业摄影编辑师完成的编辑,能否为改进基于 AI 的编辑器提供启发,并确定哪些类型的请求目前可以被 AI 编辑器成功处理?本文提出了一项独特的研究,通过分析过去 12 年(2013-2025 年)在 Reddit 社区收集的 83k 条请求,收集了 305k 条 PSR-wizard 编辑。根据人类评分,只有约 33% 的请求可以被最佳 AI 编辑器(包括 GPT-4o、Gemini-2.0-Flash、SeedEdit)满足。有趣的是,AI 编辑器在需要精确编辑的低创造性请求上表现更差,尤其在保留人物和动物身份方面常常困难重重,频繁进行非请求的润色。在另一方面,VLM 评判(如 o1)与人类评判者表现不同,可能更偏好 AI 编辑。代码与定性示例可在:https://psrdataset.github.io 获取。

关键词

引用

@article{arxiv.2505.16181,
  title  = {Understanding Generative AI Capabilities in Everyday Image Editing Tasks},
  author = {Mohammad Reza Taesiri and Brandon Collins and Logan Bolton and Viet Dac Lai and Franck Dernoncourt and Trung Bui and Anh Totti Nguyen},
  journal= {arXiv preprint arXiv:2505.16181},
  year   = {2025}
}

备注

Code and qualitative examples are available at: https://psrdataset.github.io