鲁棒性面部表情生成:基于情感感知的模态补偿框架
计算机视觉与模式识别
2024-07-25 v2
摘要
多适当面部表情生成(MAFRG)任务的目标是根据对话伙伴(即说话者)的多模态行为数据生成情境恰当且多样的听者面部行为响应。当前方法通常假设语音和面容模态数据持续可用,忽视了这些数据可能间歇性不可用的现实场景,常导致模型失效。此外,尽管利用先进的深度学习模型从说话者的多模态输入中提取信息,这些模型未能充分利用说话者的情感背景,这对于引发人类听者恰当的面部表情至关重要。为解决这些限制,我们提出情感感知模态补偿(EMC)框架。该灵活解决方案可无缝集成到现有模型中,从而保留其优势,同时在缺失模态的场景中显著提升性能和鲁棒性。我们的框架通过 Compensatory Modality Alignment(CMA)模块确保在面对缺失模态数据时具有鲁棒性。它通过情感感知注意(EA)模块生成更恰当的情感感知反应,该模块在整个编码和解码过程中融入说话者的情感信息。实验结果表明,我们的框架在原始模型结构上的 FRCorr 指标提升平均为 57.2%。在语音模态数据缺失的场景中,恰当生成性能提升,而在面容数据缺失时仅表现出最小退化。
引用
@article{arxiv.2407.15798,
title = {Robust Facial Reactions Generation: An Emotion-Aware Framework with Modality Compensation},
author = {Guanyu Hu and Jie Wei and Siyang Song and Dimitrios Kollias and Xinyu Yang and Zhonglin Sun and Odysseus Kaloidas},
journal= {arXiv preprint arXiv:2407.15798},
year = {2024}
}