REWIND 数据集:野外多模态身体运动信号的隐私保护说话状态分割
计算机视觉与模式识别
2024-03-05 v1 人工智能
机器学习
信号处理
摘要
识别人类说话行为是理解社会互动的核心任务。理想情况下,说话检测应基于个体语音录音,正如此前在会议场景中那样。然而,由于成本、后勤和隐私问题,在野外(尤其是在拥挤的社交场景中)很难获取个体语音录音。作为替代方案,基于视频和可穿戴传感器数据训练的机器学习模型,可以通过检测相关手势,以一种不具侵入性且保护隐私的方式识别语音。这些模型理想情况下应使用从语音信号获得的标签进行训练。然而,现有的社交数据集缺乏高质量的音频录音;相反,说话状态标注通常由人工标注员从视频中推断,而未针对基于音频的真值验证此方法。在本文中,我们通过发布首个公开的多模态数据集,重新审视无音频说话状态估计问题,该数据集包含 33 名受试者在专业社交活动中的高质量个体语音录音。我们提出了三种无音频说话状态分割的基线方法:a) 基于视频,b) 基于身体加速度(佩戴在胸部的加速度计),c) 基于身体姿态轨迹。在所有情况下,我们预测的是从音频中提取的 20Hz 二值说话状态信号,这是以往数据集所不具备的时间分辨率。除了提供评估各类说话状态检测方法所需的信号和真值外,REWIND 中音频的可用性使其适用于以往社交数据集无法进行的跨模态研究。最后,我们灵活的数据同意设置也为缺失模态下的多模态系统带来了新挑战。
引用
@article{arxiv.2403.01229,
title = {REWIND Dataset: Privacy-preserving Speaking Status Segmentation from Multimodal Body Movement Signals in the Wild},
author = {Jose Vargas Quiros and Chirag Raman and Stephanie Tan and Ekin Gedik and Laura Cabrera-Quiros and Hayley Hung},
journal= {arXiv preprint arXiv:2403.01229},
year = {2024}
}