寻找那个人:以人为中心的视觉常识理解中的指称定位
计算机视觉与模式识别
2022-12-15 v1 计算与语言
摘要
在包含多人的视觉场景中,人类能够根据关于此前发生之事、其心理/身体状态或意图等上下文描述来区分每个个体。上述能力严重依赖于以人为中心的常识知识与推理。例如,若要求在图像中识别“需要疗愈的人”,我们需要先知道这类人通常有受伤或痛苦表情,再找到相应的视觉线索,最终将该人定位。我们提出一项新的常识任务——以人为中心的常识指称定位,用于测试模型在给定关于此前发生之事及其心理/身体状态或意图的上下文描述时定位个体的能力。我们进一步构建了一个基准数据集 HumanCog,该数据集在 67k 张图像上标注了 130k 条带指称的常识性描述,涵盖多种常识类型与视觉场景。我们建立了一个上下文-物体感知方法作为强基线,其性能优于此前预训练与非预训练模型。进一步分析表明,丰富的视觉常识与多模态常识的有力整合至关重要,这为未来工作指明了方向。数据与代码将发布于 https://github.com/Hxyou/HumanCog。
引用
@article{arxiv.2212.06971,
title = {Find Someone Who: Visual Commonsense Understanding in Human-Centric Grounding},
author = {Haoxuan You and Rui Sun and Zhecan Wang and Kai-Wei Chang and Shih-Fu Chang},
journal= {arXiv preprint arXiv:2212.06971},
year = {2022}
}
备注
11 pages, 7 figures. EMNLP 2022-findings