中文

多说话者注意力对齐用于多模态社交互动

计算机视觉与模式识别 2025-11-25 v1

摘要

理解视频中的社交互动需要对口语和非口语线索的动态交互进行推理:谁在说话、对谁说话以及如何注视或做手势。虽然多模态大语言模型(MLLMs)是自然的候选,但仅添加视觉输入在社交任务上yield出 surprisingly inconsistent的增益。我们对状态最佳 MLLMs 中跨模态注意力的定量分析揭示了核心失败模式:在多说话者场景中,视觉和文本标记缺乏说话者一致的对齐,跨模态注意力显著弱于物体导向图像。为此,我们提出一种可集成到现有 MLLMs 中的多模态多说话者注意力对齐方法。首先,我们引入动态跨模态头选择以识别负责 grounding 的注意力头。然后,基于注意力模式和说话者位置计算的自适应社交感知注意力偏置被注入注意力机制。该偏置强化了说话者视觉表征与其言语之间的对齐,同时无需引入可训练参数或架构更改。我们将该方法集成到三个不同的 MLLMs(LLaVA-NeXT-Video、Qwen2.5-VL 和 InternVL3)并在三个基准测试(TVQA+、MMSI、OnlineMMSI)上评估。在四个社交任务中,结果表明我们的方法提升了 MLLMs 的能力并实现了最佳结果。注意力可视化确认我们的方法成功聚焦于说话者相关区域,实现了更稳健的多方社交推理。我们的实现和模型将在 https://github.com/ut-vision/SocialInteraction 提供。

关键词

引用

@article{arxiv.2511.17952,
  title  = {Multi-speaker Attention Alignment for Multimodal Social Interaction},
  author = {Liangyang Ouyang and Yifei Huang and Mingfang Zhang and Caixin Kang and Ryosuke Furuta and Yoichi Sato},
  journal= {arXiv preprint arXiv:2511.17952},
  year   = {2025}
}