LOWA:利用属性在野外定位物体
计算机视觉与模式识别
2023-06-01 v1 人工智能
摘要
我们提出 LOWA,一种在野外有效定位带属性物体的新方法。它旨在解决当前开放词汇物体检测器因缺乏实例级属性分类和稀有类名而存在的不足。为训练 LOWA,我们提出一种混合视觉-语言训练策略,以利用类名及属性信息学习物体检测与识别。借助 LOWA,用户不仅可用类名检测物体,还能通过属性定位物体。LOWA 构建于双塔视觉-语言架构之上,由一个标准 vision transformer 作为图像编码器和一个类似 transformer 作为文本编码器组成。为在实例级学习视觉与文本输入的对齐,我们通过三个训练步骤训练 LOWA:物体级训练、属性感知学习和物体与属性的自由文本联合训练。该混合训练策略首先确保正确的物体检测,然后融入实例级属性信息,最后平衡物体类别与属性敏感性。我们在开放词汇属性检测(OVAD)基准和 Visual Attributes in the Wild(VAW)数据集上评估了我们的模型在属性分类与属性定位上的性能,实验显示出强劲的零样本性能。消融研究进一步证明了我们方法各训练步骤的有效性。
引用
@article{arxiv.2305.20047,
title = {LOWA: Localize Objects in the Wild with Attributes},
author = {Xiaoyuan Guo and Kezhen Chen and Jinmeng Rao and Yawen Zhang and Baochen Sun and Jie Yang},
journal= {arXiv preprint arXiv:2305.20047},
year = {2023}
}