基于关系框域的顺序投票法用于主动物体检测
计算机视觉与模式识别
2022-06-03 v4 人工智能
机器学习
摘要
理解手-物交互的一个关键组成部分是识别主动物体——即被人手操控的物体。为了准确标定主动物体,任何方法都必须利用每个图像像素编码的信息进行推理,例如该像素属于手、物体还是背景。为了将每个像素作为证据来确定主动物体的边界框,我们提出一种逐像素投票函数。我们的逐像素投票函数以初始边界框为输入,输出改进后的主动物体边界框。该投票函数设计为:输入边界框内的每个像素对改进后的边界框投票,得票最多的框被选为输出。我们将投票函数内部生成的边界框集合称为关系框域(Relational Box Field),因为它刻画了相对于当前边界框定义的一组边界框场。虽然我们的投票函数能够改进主动物体的边界框,但一轮投票通常不足以准确标定主动物体。因此,我们重复应用投票函数以顺序改进边界框位置。然而,由于已知重复应用单步预测器(即使用我们投票函数的自回归处理)会导致数据分布偏移,我们使用强化学习(RL)缓解该问题。我们采用标准 RL 学习投票函数参数,并表明其相比标准监督学习方法提供了有意义的提升。我们在两个大规模数据集(100DOH 和 MECCANO)上进行实验,相较最先进水平分别将 AP50 性能提升了 8% 和 30%。
引用
@article{arxiv.2110.11524,
title = {Sequential Voting with Relational Box Fields for Active Object Detection},
author = {Qichen Fu and Xingyu Liu and Kris M. Kitani},
journal= {arXiv preprint arXiv:2110.11524},
year = {2022}
}
备注
In CVPR 2022. Project: https://fuqichen1998.github.io/SequentialVotingDet/