幽灵之谜:通过单正多标签学习重访情境识别
计算机视觉与模式识别
2025-09-01 v1 人工智能
摘要
情境识别 (SR) 是计算机视觉中的一个基本任务,旨在从图像中提取结构化语义摘要,通过识别关键事件及其关联实体。具体而言,给定输入图像,模型首先必须对主要视觉事件进行分类(动词分类),然后识别参与实体及其语义角色(语义角色标注),最后对这些实体进行局部化(语义角色定位)。现有方法将动词分类视为单标签问题,但我们通过全面分析表明,这种表述未能解决视觉事件识别中固有的歧义,因为同一图像可能被合理描述为多个动词类别。本文作出三项关键贡献:首先,通过实证分析揭示,由于动词类别之间的普遍语义重叠,动词分类本质上是一个多标签问题。其次,鉴于对大规模数据集进行多标签完整标注的不可行性,我们提出将动词分类重新表述为单正多标签学习 (SPMLL) 问题——这是一种在 SR 研究中新的视角。第三,我们设计了一个全面的多标签评估基准,用于 SR,仔细设计以公正评估模型在多标签setting 中的性能。为解决 SPMLL 的挑战,我们进一步开发了 Graph Enhanced Verb Multilayer Perceptron (GE-VerbMLP),其结合了图神经网络以捕获标签相关性,以及对抗训练以优化决策边界。广泛的实验表明,我们的方法在保持对传统 top-1 和 top-5 准确性指标的竞争力的同时,实现了超过 3% 的 MAP 提升。
引用
@article{arxiv.2508.21816,
title = {The Demon is in Ambiguity: Revisiting Situation Recognition with Single Positive Multi-Label Learning},
author = {Yiming Lin and Yuchen Niu and Shang Wang and Kaizhu Huang and Qiufeng Wang and Xiao-Bo Jin},
journal= {arXiv preprint arXiv:2508.21816},
year = {2025}
}
备注
Accepted by ICDM 2025