中文

USER-VLM 360:面向社交人机交互的具有用户感知微调的个性化视觉语言模型

人工智能 2025-03-03 v2 人机交互 机器人学

摘要

将视觉语言模型集成到机器人系统中,构成了使机器以更直观的方式与其周围环境交互的重大进步。虽然 VLM 提供了丰富的多模态推理,但现有方法缺乏针对特定用户的适应性,通常依赖于未能考虑个体行为、情境或社会情感细微差别的通用交互范式。当尝试定制化时,由于用户数据中未缓解的偏见引发了伦理担忧,可能导致排斥或不公平对待。为了应对这些双重挑战,我们提出了 User-VLM 360{\deg},这是一个将多模态用户建模与偏见感知优化相结合的整体框架。我们的方法特点包括:使用视觉语言信号实时调整交互的用户感知微调;通过偏好优化缓解偏见;以及带有人口统计、情感和关系元数据注释的精选 360{\deg} 社会情感交互数据集。在八个基准测试上的评估展示了最先进的结果:在个性化 VQA 中 F1 提升 35.3%,在面部特征理解中 F1 提升 47.5%,偏见减少 15%,并且比基线快 30 倍。消融研究证实了各组件的有效性,在 Pepper 机器人上的部署验证了其在不同用户间的实时适应能力。我们开源了参数高效的 3B/10B 模型和用于负责任适应的伦理验证框架。

关键词

引用

@article{arxiv.2502.10636,
  title  = {USER-VLM 360: Personalized Vision Language Models with User-aware Tuning for Social Human-Robot Interactions},
  author = {Hamed Rahimi and Adil Bahaj and Mouad Abrini and Mahdi Khoramshahi and Mounir Ghogho and Mohamed Chetouani},
  journal= {arXiv preprint arXiv:2502.10636},
  year   = {2025}
}