中文

基于 3DMM 的情绪-价位预测的数据增强技术

机器人学 2024-10-02 v1

摘要

人类通常通过多种交流渠道与他人交互。例如,身体姿态或面部表情常用于传递意图。对此类非语言线索的运用促进了预测模型的发展。一种类似的方法是从面部表情预测情绪和价位(arousal-valence, AV)。然而,在人机交互(HRI)环境中构建这些模型准确且具挑战性,因为需要处理多个主体、复杂环境以及广泛的面部表情范围。本文提出一种基于 3D 形状可塑模型(3DMM)的数据增强(DA)技术,用于提高 AV 预测器的性能。我们将其方法应用于包含三个人类的调解机器人与 HRI 场景。我们的增强方法为 SEWA 数据集中欠代表的 AV 空间中的值创建合成序列,该数据集是标注最为全面且具有连续 AV 标签的数据集。结果表明,使用我们的数据增强方法可提高在实时应用中的 AV 预测准确性和鲁棒性。本模型在 SEWA 数据集上的准确率分别为 0.793(情绪)和 0.793(价位)。

关键词

引用

@article{arxiv.2410.00349,
  title  = {Data Augmentation for 3DMM-based Arousal-Valence Prediction for HRI},
  author = {Christian Arzate Cruz and Yotam Sechayk and Takeo Igarashi and Randy Gomez},
  journal= {arXiv preprint arXiv:2410.00349},
  year   = {2024}
}