利用多任务设置实现音视频情感识别的解耦
图像与视频处理
2021-02-15 v1 声音
音频与语音处理
摘要
在音视频数据上训练的深度学习模型已成功用于实现情感识别的当前最优性能。特别地,以多任务学习训练的模型展现出额外的性能提升。然而,此类多任务模型在任务间纠缠信息,编码了训练所用真实世界数据标签分布中存在的相互依赖关系。本工作探索针对主任务情感识别与辅助人物识别任务的多模态信号表示解耦。具体而言,我们开发了一个多任务框架以提取低维嵌入,旨在捕获特定的情感信息,同时包含最少的人物身份相关信息。我们评估了三种不同的解耦技术,并报告了在保持情感识别性能的同时高达 13% 的解耦结果。
引用
@article{arxiv.2102.06269,
title = {Disentanglement for audio-visual emotion recognition using multitask setup},
author = {Raghuveer Peri and Srinivas Parthasarathy and Charles Bradshaw and Shiva Sundaram},
journal= {arXiv preprint arXiv:2102.06269},
year = {2021}
}
备注
Accepted for ICASSP 2021, 5 pages