手势属性可预测性的多模态分析
人机交互
2022-01-17 v3 机器学习
多媒体
摘要
具身对话智能体受益于能够以手势伴随其言语。尽管近年来提出了许多数据驱动的姿态生成方法,此类系统能否一致地生成传达意义的手势仍不明确。我们研究了使用当代深度学习可从语音文本和/或音频预测哪些手势属性(相位、类别与语义)。在大量实验中,我们表明与手势意义相关的手势属性(语义与类别)可仅从文本特征(时间对齐的 FastText 嵌入)预测,而不能从韵律音频特征预测,而另一方面,与节奏相关的手势属性(相位)从音频特征预测优于从文本预测。这些结果令人鼓舞,因为它们表明有可能利用机器学习模型为具身智能体配备内容上有意义的伴语手势。
引用
@article{arxiv.2108.05762,
title = {Multimodal analysis of the predictability of hand-gesture properties},
author = {Taras Kucherenko and Rajmund Nagy and Michael Neff and Hedvig Kjellström and Gustav Eje Henter},
journal= {arXiv preprint arXiv:2108.05762},
year = {2022}
}
备注
Accepted at the International Conference on Autonomous Agents and Multiagent Systems (AAMAS) 2022