野外共语气体姿势理解
计算机视觉与模式识别
2025-08-22 v2
摘要
共语气体姿势在非语言交流中发挥着重要作用。本文提出了一种针对野外共语气体姿势理解的新框架。具体而言,我们提出了三个新的任务和基准来评估模型理解气体-语音-文本关联能力:(i) 基于气体的检索,(ii) 气体词检索,以及 (iii) 使用气体的主动说话人检测。我们 presented a new approach that learns a tri-modal video-gesture-speech-text representation to solve these tasks. 通过结合全局短语对比损失和局部气体-词汇耦合损失,我们展示了可以在弱监督方式下从野外视频中学习到强大的气体表示。我们的学习表示优于先前方法,包括大型视觉-语言模型(VLM)。进一步分析表明,语音和文本模态捕获了不同于气体相关信号的信号,凸显了学习共享三模态嵌入空间的优势。该数据集、模型和代码均可在 https://www.robots.ox.ac.uk/~vgg/research/jegal 获取。
引用
@article{arxiv.2503.22668,
title = {Understanding Co-speech Gestures in-the-wild},
author = {Sindhu B Hegde and K R Prajwal and Taein Kwon and Andrew Zisserman},
journal= {arXiv preprint arXiv:2503.22668},
year = {2025}
}
备注
Main paper - 11 pages, 4 figures, Supplementary - 6 pages, 6 figures