利用多模态非言语行为线索估计演讲能力
计算机视觉与模式识别
2021-05-07 v1 多媒体
摘要
公开演讲与演讲能力在我们的教育、职业和日常生活的许多社会互动领域中起着至关重要的作用。由于我们在演讲时的意图可能与听众实际理解的内容不同,恰当传达信息的能力需要一套复杂的技能。演讲能力在早年学校阶段培养并随时间持续发展。一种能促进演讲能力高效发展的方法,是基于视觉与音频特征及机器学习对演讲中的人类行为进行自动分析。此外,该分析可用于提出改进建议以及培养与演讲能力相关的技能。在本工作中,我们研究了不同非言语行为线索(即面部、基于身体姿态以及音频相关特征)对估计演讲能力的贡献。分析在 251 名学生的视频上进行,而自动评估基于依据图宾根演讲能力量表(TIP)的人工评分。我们的分类结果在同一数据集评估中通过早期融合达到最佳性能(准确率 71.25%),在跨数据集评估中通过语音、面部和身体姿态特征的晚期融合达到最佳性能(准确率 78.11%)。类似地,回归结果在融合策略下表现最佳。
引用
@article{arxiv.2105.02636,
title = {Estimating Presentation Competence using Multimodal Nonverbal Behavioral Cues},
author = {Ömer Sümer and Cigdem Beyan and Fabian Ruth and Olaf Kramer and Ulrich Trautwein and Enkelejda Kasneci},
journal= {arXiv preprint arXiv:2105.02636},
year = {2021}
}