SCoRD:基于文本增强数据的主体条件关系检测
计算机视觉与模式识别
2024-01-08 v2
摘要
我们提出主体条件关系检测 SCoRD,其目标是给定输入主体,预测其与场景中其他对象的所有关系及其位置。基于 Open Images 数据集,我们提出了一个具有挑战性的 OIv6-SCoRD 基准,使得训练与测试划分在 subject, relation, object 三元组出现统计上存在分布偏移。为解决该问题,我们提出一种自回归模型,给定主体后,通过将输出转换为 token 序列来预测其关系、对象和对象位置。首先,我们表明先前的场景图预测方法在该基准上以主体为条件时,无法像我们所做那样详尽地枚举关系-对象对。特别地,我们的关系-对象预测 recall@3 达到 83.8%,而近期一种场景图检测器仅获 49.75%。接着,我们展示通过在训练中利用从文本描述自动获得的关系-对象对(无对象框标注可用),在关系-对象和对象框预测上均实现了改进的泛化。特别地,对于训练中无对象位置可用的 subject, relation, object 三元组,我们能在关系-对象对上获得 33.80% 的 recall@3,在其框位置上获得 26.75%。
引用
@article{arxiv.2308.12910,
title = {SCoRD: Subject-Conditional Relation Detection with Text-Augmented Data},
author = {Ziyan Yang and Kushal Kafle and Zhe Lin and Scott Cohen and Zhihong Ding and Vicente Ordonez},
journal= {arXiv preprint arXiv:2308.12910},
year = {2024}
}
备注
WACV 2024