基于声音的触摸手势与情感识别:用于增强的人机交互
人机交互
2025-01-03 v1 机器人学
声音
音频与语音处理
摘要
情感识别和触摸手势解码对于推动人机交互(HCI)至关重要,尤其是在具有情感线索和触觉感知作用的社交环境中。然而,许多类人机器人(如Pepper、Nao和Furhat)缺乏全身触觉皮肤,限制了其在基于触摸的情感和手势交互中的能力。此外,基于视觉的方法通常面临严格的GDPR合规挑战,由于需要收集个人面部数据。为解决这些限制并避免隐私问题,本文研究使用触摸期间产生的声音来识别触摸手势和分类情感的潜力,沿arousal和valence维度。使用来自28名参与者与人类机器人Pepper的触摸手势和情感交互数据集,我们设计了一个仅包含0.24M参数、0.94MB模型大小和0.7G FLOPs的音频-only轻量级触摸手势和情感识别模型。实验结果表明,所提出的基于声音的触摸手势和情感识别模型有效地识别了不同情感的arousal和valence状态,以及各种触摸手势,当输入音频长度变化时亦能实现良好效果。该模型低延迟,能够实现与著名预训练音频神经网络(PANNs)类似的性能,但具有更小的FLOPs、参数和模型大小。
引用
@article{arxiv.2501.00038,
title = {Sound-Based Recognition of Touch Gestures and Emotions for Enhanced Human-Robot Interaction},
author = {Yuanbo Hou and Qiaoqiao Ren and Wenwu Wang and Dick Botteldooren},
journal= {arXiv preprint arXiv:2501.00038},
year = {2025}
}
备注
ICASSP 2025