面向细粒度情感识别的时空模糊多模态元学习
计算机视觉与模式识别
2025-06-04 v4 机器学习
神经与进化计算
摘要
细粒度情感识别(FER)在疾病诊断、个性化推荐和多媒体挖掘等多个领域发挥着重要作用。然而,现有FER方法在实际应用中面临三个关键挑战:(i)由于现实中情感的复杂性和模糊性,它们依赖大量连续标注数据来保证准确性,这成本高昂且耗时;(ii)它们无法捕捉由情感模式变化引起的时间异质性,因为它们通常假设采样周期内的时间相关性相同;(iii)它们未考虑不同FER场景的空间异质性,即不同数据中情感信息的分布可能存在偏差或干扰。为应对这些挑战,我们提出一种时空模糊多模态元学习框架(ST-F2M)。具体而言,ST-F2M首先将多模态视频划分为多个视图,每个视图对应一种情感的一种模态。针对同一情感随机选取的多个视图构成一个元训练任务。接着,ST-F2M使用一个集成空间和时间卷积的模块对每个任务的数据进行编码,以反映空间和时间异质性。然后,基于广义模糊规则为每个任务添加模糊语义信息,这有助于处理情感的复杂性和模糊性。最后,ST-F2M通过元递归神经网络学习与情感相关的通用元知识,以实现快速且鲁棒的细粒度情感识别。大量实验表明,ST-F2M在准确性和模型效率方面优于多种最先进方法。此外,我们构建了消融研究和进一步分析,以探索ST-F2M表现优异的原因。
引用
@article{arxiv.2412.13541,
title = {Spatio-Temporal Fuzzy-oriented Multi-Modal Meta-Learning for Fine-grained Emotion Recognition},
author = {Jingyao Wang and Wenwen Qiang and Changwen Zheng and Fuchun Sun},
journal= {arXiv preprint arXiv:2412.13541},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication