RefEgo:基于 Ego4D 第一人称感知的指代表达式理解数据集
计算机视觉与模式识别
2023-10-31 v2
摘要
从第一人称视角将文本表达式定位到场景物体,是开发感知周边环境并遵循直观文本指令行动的智能体所真正需要的能力。此类能力对于眼镜设备或自主机器人在真实世界中定位所指物体必不可少。然而,在常规的图像指代表达式理解任务中,数据集多基于网络爬取数据构建,未能反映真实世界中多样的结构以完成在多样物体上定位文本表达式的任务。近期,提出了大规模第一人称视频数据集 Ego4D。Ego4D 覆盖全球多样的真实场景,包含大量室内外情形,如购物、烹饪、行走、交谈、制造等。基于 Ego4D 的第一人称视频,我们构建了广泛覆盖的基于视频的指代表达式理解数据集:RefEgo。我们的数据集包含超过 12k 视频片段与 41 小时视频指代表达式理解标注。实验中,我们将最优的 2D 指代表达式理解模型与物体跟踪算法结合,即使在困难条件下也实现了视频级所指物体跟踪:所指物体在视频中段移出画面或多件相似物体同时出现于视频中。代码见 https://github.com/shuheikurita/RefEgo
引用
@article{arxiv.2308.12035,
title = {RefEgo: Referring Expression Comprehension Dataset from First-Person Perception of Ego4D},
author = {Shuhei Kurita and Naoki Katsura and Eri Onami},
journal= {arXiv preprint arXiv:2308.12035},
year = {2023}
}
备注
15 pages, 11 figures. ICCV2023. Codes are available at https://github.com/shuheikurita/RefEgo