中文

解码情感:通过对比注意力的声学感知揭示面部表情

计算机视觉与模式识别 2024-10-18 v1 声音 音频与语音处理

摘要

表情识别对内容推荐和心理健康等应用具有巨大潜力,通过准确检测用户的情感状态。传统方法依赖摄像头或可穿戴传感器,存在隐私顾虑和额外设备负担。此外,现有基于声学的方法在训练数据分布与推断数据分布之间存在偏移时,难以保持满意的性能。本文引入 FacER+,一个主动声学面部表情识别系统,无需外部麦克风阵列。FacER+ 通过分析智能手机耳机喇叭与 3D 脸部轮廓之间发出的近场超声信号回声来提取面部表情特征。该方法不仅减少背景噪声,还能在缺乏大量训练数据的情况下识别来自不同用户的不同表情。我们 developed a 对比外部注意力模型,以在不同用户之间持续学习表情特征,减少分布差异。广泛的实验涉及 20 名志愿者(带口罩和不戴口罩),表明 FacER+ 在多样化、用户独立的真实生活场景中能够以超过 90% 的准确率准确识别六种常见面部表情,超越领先的声学感知方法 10%。FacER+ 提供了一个稳健且实用的面部表情识别解决方案。

关键词

引用

@article{arxiv.2410.12811,
  title  = {Decoding Emotions: Unveiling Facial Expressions through Acoustic Sensing with Contrastive Attention},
  author = {Guangjing Wang and Juexing Wang and Ce Zhou and Weikang Ding and Huacheng Zeng and Tianxing Li and Qiben Yan},
  journal= {arXiv preprint arXiv:2410.12811},
  year   = {2024}
}

备注

The extended version of the 2023 IEEE INFOCOM conference paper