利用多模态Transformer检测表情
音频与语音处理
2020-12-02 v1 声音
图像与视频处理
摘要
开发机器学习算法以理解人际互动参与度,可为 Amazon Alexa 等共用设备带来自然用户体验。除语音活动和注视等其他线索外,包含语音语调与面部表情的人体视听表情,可作为对话双方之间参与度的隐式信号。本研究探讨用于用户表情视听检测的深度学习算法。我们首先实现了一个带循环层的视听基线模型,其与当前最优方法相比具有竞争力。接着,我们提出带编码器层的 Transformer 架构,可更好地整合视听特征以进行表情追踪。在 Aff-Wild2 数据库上的性能表明,所提方法优于带循环层的基线架构,在唤醒度与效价描述符上分别取得约 2% 的绝对提升。此外,多模态架构相比单模态训练模型有显著提升,增益最高达 3.6%。消融实验显示了视觉模态在 Aff-Wild2 数据库表情检测中的重要性。
引用
@article{arxiv.2012.00063,
title = {Detecting expressions with multimodal transformers},
author = {Srinivas Parthasarathy and Shiva Sundaram},
journal= {arXiv preprint arXiv:2012.00063},
year = {2020}
}
备注
IEEE Spoken Language Technology Workshop 2021