中文

负责任的视觉编辑

计算机视觉与模式识别 2024-04-09 v1

摘要

随着视觉合成的最新进展,遇到具有有害影响(如仇恨、歧视或侵犯隐私)的图像的风险日益增加。关于将有害图像转化为负责任图像的研究仍未被探索。在本文中,我们提出了一个新任务,即负责任的视觉编辑,该任务涉及修改图像中的特定概念,使其更具责任感,同时最小化改动。然而,需要编辑的概念通常是抽象的,这使得定位需要修改的内容以及规划如何修改具有挑战性。为了应对这些挑战,我们提出了一种认知编辑器,通过两阶段认知过程利用大型多模态模型:(1) 感知认知过程,聚焦于需要修改的内容;(2) 行为认知过程,规划如何修改。为了减轻有害图像对研究的负面影响,我们创建了一个透明且公开的数据集 AltBear,该数据集使用泰迪熊代替人类来表达有害信息。实验表明,CoEditor 能够有效理解复杂场景中的抽象概念,并在负责任视觉编辑方面显著超越基线模型的性能。我们发现 AltBear 数据集与真实图像中发现的有害内容高度对应,提供了一致的实验评估,从而为未来的研究提供了更安全的基准。此外,CoEditor 在通用编辑方面也展现出出色的结果。我们在 https://github.com/kodenii/Responsible-Visual-Editing 发布了我们的代码和数据集。

关键词

引用

@article{arxiv.2404.05580,
  title  = {Responsible Visual Editing},
  author = {Minheng Ni and Yeli Shen and Lei Zhang and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2404.05580},
  year   = {2024}
}

备注

24 pages, 12 figures