基于三元组校准与约简的零样本场景图生成
计算机视觉与模式识别
2023-09-08 v1 多媒体
摘要
场景图生成(SGG)在下游视觉-语言任务中起着关键作用。现有的SGG方法通常在未见过三元组上的组合泛化能力较差。它们一般在含有主导三元组且标注不完整的场景图上训练,并在推理时倾向于偏置到这些见过三元组。为解决此问题,本文提出一种三元组校准与约简(T-CAR)框架。在我们的框架中,首先提出三元组校准损失以正则化多样三元组的表示,并同时挖掘标注不完整的训练场景图中的未见过三元组。此外,由于包含大量不现实组合,场景图的未见过空间通常比见过空间大数倍。因此,我们提出未见过空间约简损失,将挖掘注意力转移到合理的未见过组合上以促进模型训练。最后,我们提出一种上下文编码器,通过显式建模主体与客体之间的相对空间关系来改进未见过三元组的组合泛化。大量实验表明,我们的方法在零样本SGG上相比最先进方法取得了持续改进。代码可在https://github.com/jkli1998/T-CAR获取。
引用
@article{arxiv.2309.03542,
title = {Zero-Shot Scene Graph Generation via Triplet Calibration and Reduction},
author = {Jiankai Li and Yunhong Wang and Weixin Li},
journal= {arXiv preprint arXiv:2309.03542},
year = {2023}
}
备注
Accept in TOMM 2023