中文

GestSync:在无说话人头部画面下判定谁在说话

计算机视觉与模式识别 2023-10-10 v1

摘要

本文引入一项新的同步任务 Gesture-Sync:判定一个人的手势是否与其语音相关。相较于 Lip-Sync,Gesture-Sync 要困难得多,因为声音与身体运动之间的关系远比声音与嘴唇运动之间的关系松散。我们为该任务引入了一个双编码器模型,并比较了若干输入表示,包括 RGB 帧、关键点图像与关键点向量,评估其性能与优势。我们表明该模型可仅通过自监督学习进行训练,并在 LRS3 数据集上评估其性能。最后,我们展示了 Gesture-Sync 在音视频同步以及在不看到人脸的情况下判定人群中谁是说话者方面的应用。代码、数据集与预训练模型可见于:\url{https://www.robots.ox.ac.uk/~vgg/research/gestsync}。

关键词

引用

@article{arxiv.2310.05304,
  title  = {GestSync: Determining who is speaking without a talking head},
  author = {Sindhu B Hegde and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2310.05304},
  year   = {2023}
}

备注

Accepted in BMVC 2023, 10 pages paper, 7 pages supplementary, 7 Figures