SpeakingFaces:一个包含语音指令及视觉与热成像视频流的大规模多模态数据集
人机交互
2021-05-04 v3 计算机视觉与模式识别
多媒体
摘要
我们提出 SpeakingFaces,一个公开可用的大规模多模态数据集,旨在支持利用热成像、视觉与音频数据流组合情境下的机器学习研究;例如人机交互、生物特征认证、识别系统、域迁移与语音识别。SpeakingFaces 由完全取景人脸的高分辨率热成像与可见光光谱图像流对齐组成,并与每位受试者说出约 100 条祈使短语的音频记录同步。数据来自 142 名受试者,产生超过 13,000 条同步数据实例(约 3.8 TB)。为进行技术验证,我们展示了两个基线示例。第一个基线展示按性别分类,在干净与噪声环境中利用三种数据流的不同组合。第二个示例包含热成像到视觉的人脸图像翻译,作为域迁移的一个实例。
引用
@article{arxiv.2012.02961,
title = {SpeakingFaces: A Large-Scale Multimodal Dataset of Voice Commands with Visual and Thermal Video Streams},
author = {Madina Abdrakhmanova and Askat Kuzdeuov and Sheikh Jarju and Yerbolat Khassanov and Michael Lewis and Huseyin Atakan Varol},
journal= {arXiv preprint arXiv:2012.02961},
year = {2021}
}
备注
20 pages, 9 figures, 5 tables