中文

面向未见三元组:用于场景图生成的文本-图像联合高效学习

计算机视觉与模式识别 2023-06-26 v1

摘要

场景图生成(SGG)旨在结构化且全面地表示图像中的对象及其关联,其可显著惠及场景理解及其他相关下游任务。现有SGG模型常难以解决由有偏数据集引起的长尾问题。然而,即便这些模型能更好地拟合特定数据集,它们也可能难以解决未包含在训练集中的未见三元组。多数方法倾向于输入完整三元组并基于统计机器学习学习整体特征。此类模型难以预测未见三元组,因为训练集中的对象和谓词在测试集中以新颖三元组的形式被不同地组合。在本工作中,我们提出文本-图像联合场景图生成(TISGG)模型,以解决未见三元组问题并提升SGG模型的泛化能力。我们提出联合特征学习(JFL)模块和基于事实知识的精炼(FKR)模块,在特征层级分别学习对象和谓词类别,并将其与相应视觉特征对齐,从而使模型不再受限于三元组匹配。此外,由于我们观察到长尾问题亦影响泛化能力,我们设计了一种新颖的平衡学习策略,包括字符引导采样(CGS)和信息重加权(IR)模块,以根据各谓词的特性提供量身定制的学习方法。大量实验表明我们的模型达到了最先进性能。更具体地,TISGG在Visual Genome数据集的PredCls子任务上将zR@20(零样本召回率)性能提升了11.7%。

关键词

引用

@article{arxiv.2306.13420,
  title  = {Towards Unseen Triples: Effective Text-Image-joint Learning for Scene Graph Generation},
  author = {Qianji Di and Wenxi Ma and Zhongang Qi and Tianxiang Hou and Ying Shan and Hanzi Wang},
  journal= {arXiv preprint arXiv:2306.13420},
  year   = {2023}
}