中文

SocialFusion:解决预训练视觉语言模型中的社交退化问题

计算机视觉与模式识别 2026-02-03 v2 人工智能

摘要

从视觉线索理解社交互动是社交能力 AI 的基本挑战。虽然强大的预训练视觉语言模型(VLM)显示出卓越的通用能力,但它们 surprisingly 难以同时统一和学习多个社交感知任务,常常出现负迁移。我们识别出这种负迁移源于我们称之为“社交退化”的关键问题,即 VLM 的通用视觉-语言预训练过程会损害视觉编码器表示细微社交信息的能力。我们通过线性表示探针和梯度冲突分析两个视角进一步研究了这种行为,发现两者都在退化中发挥作用,尤其是前者,在 VLM 预训练过程中被显著削弱。为解决这些问题,我们提出了 SocialFusion,一个学习冻结视觉编码器与语言模型之间最小连接的统一框架。与现有的 VLM 相比,它在所有五个社交任务上都表现出正迁移,利用任务间的协同效应来提升整体性能,并在各种基准上实现与任务特定 SOTA 模型相当的性能。我们的发现表明,当前的 VLM 预训练策略可能损害获取通用社交能力,凸显了需要更加社交感知的训练范式的重要性。

关键词

引用

@article{arxiv.2512.01148,
  title  = {SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models},
  author = {Hamza Tahboub and Weiyan Shi and Gang Hua and Huaizu Jiang},
  journal= {arXiv preprint arXiv:2512.01148},
  year   = {2026}
}

备注

22 pages, 10 figures. Published in Transactions on Machine Learning Research (TMLR)