中文

DiffAugment:基于扩散模型的长尾视觉关系识别

计算机视觉与模式识别 2025-06-03 v2

摘要

视觉关系识别(Visual Relationship Recognition, VRR)任务旨在识别图像中两个交互对象之间的关系,由于<主体,关系,客体>三元组的分布广泛存在且高度不平衡,该任务极具挑战性。为克服现有 VRR 方法中由此产生的性能偏差,我们引入了 DiffAugment——该方法首先利用 WordNet 在语言空间增强尾类,然后利用扩散模型(Diffusion Models)的生成能力扩展少数类的视觉空间。我们提出了一种基于每个<S,R,O>三元组难度的新型难度感知组件,并证明了难度感知扩散在生成尾类视觉嵌入方面的有效性。我们还提出了一种基于主体和客体的新型扩散采样种子策略,以提高生成视觉嵌入的判别能力。在 GQA-LT 数据集上的广泛实验表明,使用扩散增强样本在主体/客体及关系的平均类准确率上取得了显著提升。

关键词

引用

@article{arxiv.2401.01387,
  title  = {DiffAugment: Diffusion based Long-Tailed Visual Relationship Recognition},
  author = {Parul Gupta and Tuan Nguyen and Abhinav Dhall and Munawar Hayat and Trung Le and Thanh-Toan Do},
  journal= {arXiv preprint arXiv:2401.01387},
  year   = {2025}
}