从第三人称到第一人称:合成与检索的数据集与基线方法
计算机视觉与模式识别
2018-12-04 v1
摘要
第一人称(自我中心)与第三人称(外部中心)视频本质上截然不同。近年来两种视角间的关系已被研究,但尚待充分探索。本工作中,我们引入两个同时记录自我中心与外部中心视频的数据集(合成与自然/真实)。我们还从两方面探究这两个域(自我中心与外部中心)的关联。首先,我们利用条件生成对抗网络(cGAN)从外部中心域合成自我中心域的图像。我们表明,在充足训练数据下,给定外部中心视频,我们的网络能够幻构出从自我中心视角看世界的模样。其次,我们解决两视角间的跨视角检索问题。给定自我中心查询帧(或其瞬时光流),我们从图库中检索其对应的外部中心帧(或光流)。我们表明使用合成数据有利于检索真实数据。我们展示从合成域到自然/真实域的域适应有助于诸如检索等任务。我们相信所呈现的数据集与提出的基线方法为该方向的进一步研究提供了新机遇。代码与数据集已公开可用。
引用
@article{arxiv.1812.00104,
title = {From Third Person to First Person: Dataset and Baselines for Synthesis and Retrieval},
author = {Mohamed Elfeki and Krishna Regmi and Shervin Ardeshir and Ali Borji},
journal= {arXiv preprint arXiv:1812.00104},
year = {2018}
}