可学习 PINs:面向人物身份跨模态嵌入
计算机视觉与模式识别
2018-07-27 v2
摘要
我们提出并研究了一种对人脸与语音敏感的联合嵌入。该嵌入支持从语音到人脸以及从人脸到语音的跨模态检索。我们的贡献如下:第一,我们表明该嵌入可从说话人脸视频中学习,无需任何身份标签,采用一种跨模态自监督形式;第二,我们针对该任务开发了用于困难负样本挖掘的课程学习调度策略,这对学习成功进行至关重要;第三,我们在多种场景下演示并评估了训练时未见未闻身份的跨模态检索,并为这一新任务建立了基准;最后,我们展示了利用该联合嵌入自动检索并标注电视剧中角色的应用。
引用
@article{arxiv.1805.00833,
title = {Learnable PINs: Cross-Modal Embeddings for Person Identity},
author = {Arsha Nagrani and Samuel Albanie and Andrew Zisserman},
journal= {arXiv preprint arXiv:1805.00833},
year = {2018}
}
备注
To appear in ECCV 2018