中文

UniQ:基于任务特定查询的统一解码器用于高效场景图生成

计算机视觉与模式识别 2025-01-13 v1

摘要

场景图生成是一种场景理解任务,旨在识别目标实体并推理它们在给定图像中的关系。与基于大型目标检测器(例如 Faster R-CNN)的流行两阶段方法相比,一阶段方法集成了一组固定大小的可学习查询,以联合推理关系三元组 <主体,谓词,客体>。这种范式以显著减少的参数和计算开销展现了稳健的性能。然而,一阶段方法的挑战源于弱纠缠问题,其中涉及关系的实体既需要三元组内共享的耦合特征,又需要解耦的视觉特征。以前的方法要么采用单个解码器进行耦合三元组特征建模,要么采用多个解码器进行单独的视觉特征提取,但未能兼顾两者。在本文中,我们引入了 UniQ,一种具有任务特定查询架构的统一解码器,其中任务特定查询分别为主体、客体和谓词生成解耦的视觉特征,而统一解码器则实现了关系三元组内的耦合特征建模。在 Visual Genome 数据集上的实验结果表明,UniQ 的性能优于一阶段和两阶段方法。

关键词

引用

@article{arxiv.2501.05687,
  title  = {UniQ: Unified Decoder with Task-specific Queries for Efficient Scene Graph Generation},
  author = {Xinyao Liao and Wei Wei and Dangyang Chen and Yuanyuan Fu},
  journal= {arXiv preprint arXiv:2501.05687},
  year   = {2025}
}

备注

10 pages, 5 figures