洗牌再组装:学习对象无关视觉关系特征
计算机视觉与模式识别
2018-08-02 v1
摘要
由于完整标注视觉关系(即(obj1, rel, obj2)三元组)代价极为高昂,关系模型不可避免地偏向于具有有限成对模式的对象类,导致对稀有或未见对象组合的泛化能力较差。因此,我们有兴趣学习对象无关的视觉特征以构建更具泛化性的关系模型。所谓“无关”,是指该特征较少偏向于成对对象的类别。为缓解偏差,我们提出一种新颖的\texttt{Shuffle-Then-Assemble}(洗牌再组装)预训练策略。首先,我们丢弃图像中所有三元组关系标注,留下两个无obj1-obj2对齐的未配对对象域。随后,我们的特征学习旨在恢复可能的obj1-obj2对。具体而言,我们设计了两域间的残差变换循环,以捕捉共享而非对象特定的视觉模式。在两个视觉关系基准上的大量实验表明,使用我们的预训练特征,朴素关系模型可得到一致提升,甚至优于其他最先进(state-of-the-art)关系模型。代码已发布于:\url{https://github.com/yangxuntu/vrd}。
引用
@article{arxiv.1808.00171,
title = {Shuffle-Then-Assemble: Learning Object-Agnostic Visual Relationship Features},
author = {Xu Yang and Hanwang Zhang and Jianfei Cai},
journal= {arXiv preprint arXiv:1808.00171},
year = {2018}
}