基于弱监督技术的多模态视觉概念学习
计算机视觉与模式识别
2023-09-26 v3
摘要
尽管存在大量伴随描述性文本的视频数据,利用自然语言中所含信息来自动识别视频概念并非总是易事。为此,本文中我们使用文本线索作为监督手段,引入两种扩展多示例学习(MIL)框架的弱监督技术:模糊集多示例学习(FSMIL)和概率标签多示例学习(PLMIL)。前者用模糊集编码语言描述的时空不精确性,而后者用概率标签对每种描述的语义的不同解释建模,二者均通过凸优化算法表述。此外,我们提供一种在复杂语义存在下提取弱标签的新技术,其由语义相似度计算组成。我们在两个不同问题上评估我们的方法,即人脸与动作识别,所用具有挑战性和真实性的设定为配有剧本的电影,包含在 COGNIMUSE 数据库中。我们表明,在两项任务上,我们的方法都大幅优于一种最先进的弱监督方法以及其他基线。
引用
@article{arxiv.1712.00796,
title = {Multimodal Visual Concept Learning with Weakly Supervised Techniques},
author = {Giorgos Bouritsas and Petros Koutras and Athanasia Zlatintsi and Petros Maragos},
journal= {arXiv preprint arXiv:1712.00796},
year = {2023}
}
备注
CVPR 2018