中文

基于多尺度特征增强与模态增强的非理想视听数据多模态表现型人格识别

声音 2025-03-11 v1 人工智能

摘要

自动人格识别是计算机科学与心理学交叉领域的研究热点,在人机交互中的个性化应用服务等场景中具有广泛应用。本文针对视觉和听觉模态数据建立了一个端到端的多模态表现型人格识别网络,通过特征级融合有效地融合了两种模态的特征,并利用交叉注意力机制融合了两种模态数据的特征;同时提出了一个多尺度特征增强模块,增强了视觉和听觉模态有效特征信息的表达,并抑制了冗余信息的干扰。此外,在训练过程中,本文提出了一种模态增强训练策略,以模拟模态缺失和噪声干扰等非理想数据情况,增强了模型对非理想数据场景的适应性并提高了模型的鲁棒性。实验结果表明,本文提出的方法在人格分析数据集 ChaLearn First Impression 上能够实现 0.916 的 Big Five 人格平均准确率,优于基于视听和音视频双模态的现有其他方法。消融实验也分别验证了本文提出的多尺度特征增强模块和模态增强策略对模型性能的贡献。最后,我们在推理阶段模拟了六种非理想数据场景,以验证模态增强策略对模型鲁棒性的提升。

关键词

引用

@article{arxiv.2503.06108,
  title  = {Multi-modal expressive personality recognition in data non-ideal audiovisual based on multi-scale feature enhancement and modal augment},
  author = {Weixuan Kong and Jinpeng Yu and Zijun Li and Hanwei Liu and Jiqing Qu and Hui Xiao and Xuefeng Li},
  journal= {arXiv preprint arXiv:2503.06108},
  year   = {2025}
}