中文

基于多模态预训练模型的社交机器人人口统计学用户建模

人工智能 2025-02-18 v1 计算机视觉与模式识别

摘要

本文研究了多模态预训练模型在基于视觉-语言人口统计数据用户画像任务中的性能。这些模型对于社交机器人适应人类用户的需求和偏好至关重要,从而提供个性化响应并增强交互质量。首先,我们引入了两个专门策划的数据集,用于表示源自用户面部图像的人口统计学特征。接下来,我们评估了一个突出的对比多模态预训练模型 CLIP 在这些数据集上的性能,包括其开箱即用的状态以及微调后的状态。初步结果表明,在不进行微调的情况下,CLIP 在将图像与人口统计学描述相匹配时表现欠佳。尽管微调显著增强了其预测能力,但该模型在有效泛化细微的人口统计学差异方面仍存在局限性。为了解决这个问题,我们提出采用掩码图像建模策略来提高泛化能力并更好地捕捉细微的人口统计学属性。该方法为在多模态用户建模任务中增强人口统计学敏感性提供了一条途径。

关键词

引用

@article{arxiv.2502.10642,
  title  = {Demographic User Modeling for Social Robotics with Multimodal Pre-trained Models},
  author = {Hamed Rahimi and Mouad Abrini and Mahdi Khoramshahi and Mohamed Chetouani},
  journal= {arXiv preprint arXiv:2502.10642},
  year   = {2025}
}