视觉社会关系识别
计算机视觉与模式识别
2018-12-17 v1
摘要
社会关系是人类社会结构的基础。开发计算模型以从视觉数据中理解社会关系,对于构建能够在社会环境中更好地与人类交互的智能机器至关重要。在本工作中,我们研究了图像中的视觉社会关系识别问题。我们提出了一种用于社会关系识别的双注视(Dual-Glance)模型,其中第一次注视聚焦于感兴趣的人物,第二次注视利用注意力机制挖掘上下文线索。为支持本研究,我们整理了一个大规模的社会情境下人物(People in Social Context, PISC)数据集,包含 23,311 张图像和 79,244 对带有社会关系标注的人物对。由于视觉识别社会关系具有一定程度的不确定性,我们进一步提出了一种自适应焦点损失(Adaptive Focal Loss)来利用模糊标注以实现更有效的学习。我们进行了大量实验,从定量和定性角度证明所提方法的有效性,该方法在社会关系识别上取得了最先进的(state-of-the-art)性能。
引用
@article{arxiv.1812.05917,
title = {Visual Social Relationship Recognition},
author = {Junnan Li and Yongkang Wong and Qi Zhao and Mohan S. Kankanhalli},
journal= {arXiv preprint arXiv:1812.05917},
year = {2018}
}
备注
arXiv admin note: text overlap with arXiv:1708.00634