图像中结构化事实的自动标注
计算与语言
2016-04-11 v3 计算机视觉与模式识别
摘要
受事实级图像理解应用的启发,我们提出了一种从带描述文本的图像中收集结构化视觉事实数据的自动方法。结构化事实的例子包括属性对象(例如 <flower, red>)、动作(例如 <baby, smile>)、交互(例如 <man, walking, dog>)以及位置信息(例如 <vase, on, table>)。收集的标注采用事实-图像对的形式(例如 <man, walking, dog> 和包含该事实的图像区域)。利用一种语言方法,所提方法能够根据人类判断以83%的准确率收集数十万条视觉事实标注。我们的方法自动收集了超过380,000条视觉事实标注和超过110,000个独特视觉事实,来自带描述文本的图像,并在标准CPU平台上少于一天的处理时间内将其定位在图像中。
引用
@article{arxiv.1604.00466,
title = {Automatic Annotation of Structured Facts in Images},
author = {Mohamed Elhoseiny and Scott Cohen and Walter Chang and Brian Price and Ahmed Elgammal},
journal= {arXiv preprint arXiv:1604.00466},
year = {2016}
}