主体及其客体:以人为中心定位交互对象以理解重要性
计算机视觉与模式识别
2016-04-19 v1
摘要
理解包含人物的图像通常需要理解他们与其他物体或人物的交互。因此,给定一张新图像,视觉系统应能推断出哪些其他物体/人物在给定人物的活动中扮演重要角色。然而,现有方法仅限于学习特定动作的交互(例如,网球运动员发球时的姿势如何与其球拍位置相关)以改进识别,这使得它们无法推理训练数据中未观察到的动作或物体的新型交互。我们提出预测新图像中的“交互对象”——即定位人物动作的客体。给定一张检测到人物的任意图像,目标是生成一个显著性图,指示该人物的交互对象最可能出现的位置和尺度。为此,我们探索了学习 (a) 人物姿势、注视和场景线索的表征与 (b) 交互对象的位置和尺度之间通用的、与动作无关的联系的方法。我们在新收集的 UT Interactee 数据集上提供了结果,该数据集包含来自 SUN、PASCAL 和 COCO 的超过 10,000 张图像。我们表明,所提出的交互信息显著性度量在四个任务中具有实际效用:上下文物体检测、图像重定向、预测物体重要性以及数据驱动的自然语言场景描述。所有四个场景都揭示了将主体与其客体联系起来以理解图像故事的价值。
引用
@article{arxiv.1604.04842,
title = {Subjects and Their Objects: Localizing Interactees for a Person-Centric View of Importance},
author = {Chao-Yeh Chen and Kristen Grauman},
journal= {arXiv preprint arXiv:1604.04842},
year = {2016}
}