中文

TeamLLM:探索 LLM 用于多模态团队互动预测的能力

人机交互 2026-04-13 v1 新兴技术

摘要

预测团队行为,即个体在协作任务期间的协调、沟通和互动方式,对于设计能够通过实时预测和真实模拟协作情景来支持团队绩效的系统至关重要。大型语言模型( LLM) 已显示出处理传感器数据进行人类活动识别( HAR)的潜力,但其在团队动态或群体水平多模态感知方面的能力尚未探索。本文研究 LLM 是否能从协作混合现实环境中的多模态传感器数据预测团队协调模式。我们将层次化上下文——个体行为轮廓、群体结构属性和时间活动上下文——编码为自然语言,并评估三种 LLM 适应范式(零-shot、few-shot 和监督微调)相对于统计基线的方法。我们在 16 组(64 名参与者、~25 小时的传感器数据)上的评估显示,LLM 在语言驱动的行为方面实现了 LSTM 基线的 3.2 倍改进,微调达到 96% 的对话预测准确率,同时保持亚 35ms 的延迟。除了性能提升之外,我们还描述了基于文本的 LLM 用于多模态感知的边界,因为 turn-taking 映射到语言模式,而共享或共同注意可能需要空间和视觉推理,文本 LLM 无法捕获。我们进一步识别了仿真模式的脆弱性(来自级联上下文错误的 83% 下降)以及 few-shot 对示例选择策略的最小敏感性。这些发现为 LLM 在 CPS/IoT 多模态感知中用于团队动态提供了指南,并指导了未来多模态基础模型的设计。

关键词

引用

@article{arxiv.2604.08771,
  title  = {TeamLLM: Exploring the Capabilities of LLMs for Multimodal Group Interaction Prediction},
  author = {Diana Romero and Xin Gao and Daniel Khalkhali and Salma Elmalaki},
  journal= {arXiv preprint arXiv:2604.08771},
  year   = {2026}
}