中文

AtteConDA:多条件扩散模型中基于注意力的冲突抑制与合成数据增强

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

近期的条件图像生成方法可以通过生成忠实于草图、人体姿态、分割图和深度等条件的图像来提高可控性。通过将这些技术应用于图像增强同时保留标注,生成的图像可用作额外的训练数据,从而提升识别性能。然而,对于诸如交通规则提取和驾驶行为理解等高级驾驶任务,仅将标注作为条件是不够的。相反,必须在增强图像的同时保留原始场景的详细高级结构。一种可能的解决方案是使用多个条件,以便生成的图像在生成后保留多样的结构线索。然而,当使用多个条件时,条件之间的冲突可能会阻碍可靠的结构保留。在这项工作中,我们将从原始图像中提取的语义分割、深度和边缘输入到多条件图像生成模型中,从而提供丰富的结构信息作为条件。我们进一步提出了一种处理多个条件之间冲突的建模方法,并表明它能够生成具有更强结构保留的图像。我们还构建了用于驾驶任务的生成框架和评估协议,为与先前和未来的模型进行比较奠定了基础。因此,这项工作通过解决多条件生成中的条件冲突,为图像生成研究做出了贡献,并为缓解高级自动驾驶任务中的数据稀缺问题迈出了重要一步。

关键词

引用

@article{arxiv.2605.09425,
  title  = {AtteConDA: Attention-Based Conflict Suppression in Multi-Condition Diffusion Models and Synthetic Data Augmentation},
  author = {Shogo Noguchi},
  journal= {arXiv preprint arXiv:2605.09425},
  year   = {2026}
}

备注

44 pages, 20 figures. Code and project page available at: https://github.com/ShogoNoguchi/AtteConDA