中文

基于图驱动的多模态特征学习框架用于显性人格评估

计算机视觉与模式识别 2025-06-03 v2 计算与语言 多媒体

摘要

自动预测人格特征在计算机视界中已成为一个具有挑战性的问题。本文引入一种创新的多模态特征学习框架,用于短视频中的人格分析。对于视觉处理,我们构建面部图谱,设计包含注意力机制的基于 Geo 的双流网络,融合图卷积网络 (GCN) 和卷积神经网络 (CNN) 以捕获静态面部表情。此外,采用 ResNet18 和 VGGFace 网络在帧级别提取全局场景和面部外观特征。为捕获动态时间信息,我们整合了双向门控循环单元 (BiGRU) 和时间注意力模块以提取关键帧表示。为增强模型的鲁棒性,我们采用 VGGish CNN 提取音频特征,采用 XLM-Roberta 提取文本特征。最后,引入多模态通道注意力机制集成不同模态,并使用多层感知机 (MLP) 回归模型预测人格特征。实验结果确认,我们提出的框架在性能上优于现有方法。

关键词

引用

@article{arxiv.2504.11515,
  title  = {Graph-Driven Multimodal Feature Learning Framework for Apparent Personality Assessment},
  author = {Kangsheng Wang and Chengwei Ye and Huanzhen Zhang and Linuo Xu and Shuyan Liu},
  journal= {arXiv preprint arXiv:2504.11515},
  year   = {2025}
}

备注

The article contains serious scientific errors and cannot be corrected by updating the preprint