中文

日常家庭环境中基于可穿戴传感的 foreground 语音自动检测:一种迁移学习方法

声音 2022-03-23 v1

摘要

声学传感已被证明是健康与人类行为分析众多应用的有效基础。在这项工作中,我们关注于从智能手表捕获的音频中检测自然场景下面对面社交互动的问题。作为检测社交互动的第一步,区分佩戴手表个体的语音与附近所有其他声音(例如其他个体的语音和环境声音)至关重要。这在现实场景中非常具有挑战性,因为互动是自发发生的,且监督模型无法事先训练以识别动态社交环境的全部复杂性。在本文中,我们引入一种基于迁移学习的方法来检测佩戴智能手表的用户的 foreground 语音。该方法的一个亮点是它不依赖于收集语音样本来构建特定用户模型。相反,该方法基于从公共数据集导出的通用说话人表征的知识迁移。我们的实验表明,我们的方法性能与全监督模型相当,F1 分数为 80%。为评估该方法,我们收集了一个数据集,包含在 18 个家庭中由 39 名参与者执行各种半受控任务时记录的 31 小时智能手表音频。

关键词

引用

@article{arxiv.2203.11294,
  title  = {Automated detection of foreground speech with wearable sensing in everyday home environments: A transfer learning approach},
  author = {Dawei Liang and Zifan Xu and Yinuo Chen and Rebecca Adaimi and David Harwath and Edison Thomaz},
  journal= {arXiv preprint arXiv:2203.11294},
  year   = {2022}
}

备注

Submitted to Interspeech 2022