读、看与检测:基于图像-描述文本对的边界框标注
计算机视觉与模式识别
2023-06-13 v1 人工智能
摘要
为降低数据标注成本,人们已提出多种目标检测方法。例如,弱监督目标检测(WSOD)方法在训练时仅依赖图像级标注。遗憾的是,数据标注仍然昂贵,因为标注者必须提供描述每幅图像内容的类别,且标注被限制在固定类别集合内。在本文中,我们提出一种利用一种更弱监督形式——图像-描述文本对——来定位并标注图像中物体的方法。通过借助视觉-语言(VL)模型与自监督视觉Transformer(ViT)的最新进展,我们的方法能够以弱监督方式执行短语定位与目标检测。我们的实验证明了方法的有效性:在 Flickr30k Entities 上取得 47.51% 的短语定位 recall@1 分数,并在仅依赖图像-描述文本对时于 MS COCO 上以 21.1 mAP 50 和 10.5 mAP 50:95 的成绩确立了目标检测的新最优水平。
引用
@article{arxiv.2306.06149,
title = {Read, look and detect: Bounding box annotation from image-caption pairs},
author = {Eduardo Hugo Sanchez},
journal= {arXiv preprint arXiv:2306.06149},
year = {2023}
}