中文

用于漫画验证与识别的深度跨模态学习(CaVINet)

计算机视觉与模式识别 2018-08-01 v1

摘要

从不同模态中学习是一项具有挑战性的任务。本文研究漫画与视觉图像模态之间跨模态人脸验证与识别这一挑战性问题。漫画具有对人面部特征的夸张表现。由于漫画的显著变化,构建用于从该模态识别和验证数据的视觉模型是一项极其困难的任务。失真明显更少的视觉图像可作为分析漫画模态的桥梁。我们引入一个公开可用的大型漫画-视觉数据集 [CaVI],包含来自两种模态的图像,捕捉了同一身份漫画中的丰富变化。本文提出首个跨模态架构,利用深度学习网络学习跨模态的相似表示,处理漫画的极端失真。我们使用两个卷积网络及受正交性约束的变换,以捕捉共享与模态特定的表示。与先前研究不同,我们的方法既不依赖手动提取的面部标志点来学习表示,也不依赖人的身份来进行验证。学习到的共享表示在验证未见过图像时达到 91% 准确率,在未见身份上达到 75% 准确率。此外,通过结合共享与模态特定表示进行知识迁移以识别图像中的身份,在漫画上取得了 85% 首位识别准确率、在视觉图像上取得了 95% 首位识别准确率的前所未有的性能。

关键词

引用

@article{arxiv.1807.11688,
  title  = {Deep Cross Modal Learning for Caricature Verification and Identification(CaVINet)},
  author = {Jatin Garg and Skand Vishwanath Peri and Himanshu Tolani and Narayanan C Krishnan},
  journal= {arXiv preprint arXiv:1807.11688},
  year   = {2018}
}