GAME:通过图结构学习多模态交互以进行人格特质估计
计算机视觉与模式识别
2025-06-03 v2 人工智能
摘要
从短视频中进行表观人格分析面临着视觉、听觉和文本线索复杂交互带来的重大挑战。在本文中,我们提出了 GAME,一个图增强多模态编码器,旨在鲁棒地建模和融合多源特征以进行自动人格预测。对于视觉流,我们构建了一个面部图,并引入了一个双分支 Geo 双流网络,该网络结合了图卷积网络(GCN)和带有注意力机制的卷积神经网络(CNN),以捕捉基于结构和外观的面部线索。作为补充,使用预训练的 ResNet18 和 VGGFace 主干网络提取全局上下文和身份特征。为了捕捉时间动态,帧级特征由一个增强了时间注意力模块的 BiGRU 处理。同时,音频表示从 VGGish 网络导出,语言语义通过 XLM-Roberta 变换器捕捉。为了实现有效的多模态集成,我们提出了一个基于通道注意力的融合模块,随后是一个用于预测人格特质的多层感知机(MLP)回归头。大量实验表明,GAME 在多个基准测试中持续优于现有方法,验证了其有效性和泛化能力。
引用
@article{arxiv.2505.03846,
title = {GAME: Learning Multimodal Interactions via Graph Structures for Personality Trait Estimation},
author = {Kangsheng Wang and Yuhang Li and Chengwei Ye and Yufei Lin and Huanzhen Zhang and Bohan Hu and Linuo Xu and Shuyan Liu},
journal= {arXiv preprint arXiv:2505.03846},
year = {2025}
}
备注
The article contains serious scientific errors and cannot be corrected by updating the preprint