中文

将姿态作为一种模态:基于心理学的多模态人格识别网络与新型多模态数据集

计算机视觉与模式识别 2025-03-18 v1 机器学习

摘要

近年来,基于多模态数据预测大五人格(Big Five)特征受到人工智能(AI)领域的广泛关注。然而,现有计算模型往往难以实现令人满意的性能。心理学研究表明,姿态与人格特征之间存在强烈相关性,但以往研究在计算模型中鲜有考虑姿态数据。为弥补这一差距,我们开发了一个新型多模态数据集,包含36个问题的虚拟访谈录像(287名参与者),以及作为标签的自报告的大五人格评分。为有效利用该多模态数据,我们引入Psychology-Inspired Network(PINet),其包括三个关键模块:Multimodal Feature Awareness(MFA)、Multimodal Feature Interaction(MFI)以及Psychology-Informed Modality Correlation Loss(PIMC Loss)。MFA模块利用Vision Mamba块捕获与人格相关的综合视觉特征,而MFI模块高效地融合多模态特征。PIMC Loss基于心理学理论,引导模型在不同人格维度上强调不同模态。实验结果表明,PINet优于多个最先进的基准模型。此外,PINet的三个模块对模型整体性能贡献基本相等。将姿态数据纳入显著提升了模型性能,其中姿态模态在五个模态中排名位居中等位置。这些发现弥补了现有人格相关数据集缺乏全身姿态数据的不足,为提高人格预测模型的准确率提供了新方法,凸显了将心理学见解整合到AI框架中的重要性。

关键词

引用

@article{arxiv.2503.12912,
  title  = {Pose as a Modality: A Psychology-Inspired Network for Personality Recognition with a New Multimodal Dataset},
  author = {Bin Tang and Keqi Pan and Miao Zheng and Ning Zhou and Jialu Sui and Dandan Zhu and Cheng-Long Deng and Shu-Guang Kuai},
  journal= {arXiv preprint arXiv:2503.12912},
  year   = {2025}
}

备注

9 pages, 6 figures, AAAI 2025 Oral