图像语义关系生成
计算机视觉与模式识别
2022-10-21 v1 计算与语言
摘要
场景图提供了超越图像的结构化语义理解。对于图像检索、视觉问答、视觉关系检测乃至自动驾驶技术等下游任务,场景图不仅能提炼复杂的图像信息,还能利用语义级关系纠正视觉模型的偏差,具有广阔的应用前景。然而,构建图标注的高昂人工成本可能阻碍 PSG 在实际场景中的应用。受人们通常先识别主体与客体、再确定二者之间关系的观察启发,我们提出将场景图生成任务解耦为两个子任务:1) 图像分割任务以选取合格对象;2) 受限自回归文本生成任务以生成给定对象间的关系。因此,本文提出图像语义关系生成(ISRG),一种简洁而有效的图像到文本模型,其在 OpenPSG 数据集上取得 31 分,并分别超越强基线 16 分(ResNet-50)和 5 分(CLIP)。
引用
@article{arxiv.2210.11253,
title = {Image Semantic Relation Generation},
author = {Mingzhe Du},
journal= {arXiv preprint arXiv:2210.11253},
year = {2022}
}