中文

可学习 PINs:面向人物身份跨模态嵌入

计算机视觉与模式识别 2018-07-27 v2

摘要

我们提出并研究了一种对人脸与语音敏感的联合嵌入。该嵌入支持从语音到人脸以及从人脸到语音的跨模态检索。我们的贡献如下:第一,我们表明该嵌入可从说话人脸视频中学习,无需任何身份标签,采用一种跨模态自监督形式;第二,我们针对该任务开发了用于困难负样本挖掘的课程学习调度策略,这对学习成功进行至关重要;第三,我们在多种场景下演示并评估了训练时未见未闻身份的跨模态检索,并为这一新任务建立了基准;最后,我们展示了利用该联合嵌入自动检索并标注电视剧中角色的应用。

关键词

引用

@article{arxiv.1805.00833,
  title  = {Learnable PINs: Cross-Modal Embeddings for Person Identity},
  author = {Arsha Nagrani and Samuel Albanie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1805.00833},
  year   = {2018}
}

备注

To appear in ECCV 2018