通过多 LLM 协作推理提升人类中心动态场景理解
统计力学
2026-04-09 v2 软凝聚态物质
摘要
人类中心的动态场景理解在增强机器人和自动驾驶系统的能力方面发挥着关键作用,其中基于视频的人类-物体相互作用(V-HOI)检测是语义场景理解中的关键任务,旨在全面理解视频中的 HOI 关系,以利于移动机器人和自动驾驶系统的行为决策。尽管前面的 V-HOI 检测模型在特定数据集上取得了显著进展,但仍缺乏类似人类一样的普遍推理能力,以有效诱导 HOI 关系。在本研究中,我们提出 V-HOI 多 LLM 协作推理(V-HOI MLCR),一种新型框架由一系列即插即用模块组成,可通过利用不同预训练大型语言模型(LLM)的强大推理能力来提升当前 V-HOI 检测模型的性能。我们设计了不同 LLM 的两阶段协作系统用于 V-HOI 任务。具体而言,在第一阶段,我们设计跨智能体推理方案以利用 LLM 从不同方面进行推理。在第二阶段,我们进行多 LLM 辩论,以基于不同 LLM 中不同知识获得最终推理答案。此外,我们构思了一个辅助训练策略,利用 CLIP——一种大型视觉-语言模型——增强基本 V-HOI 模型的判别能力,以更好地与 LLM 协作。我们通过在多个视角上证明了本设计的优越性,以提高基本 V-HOI 模型预测准确率。
引用
@article{arxiv.2403.10106,
title = {Motility-Induced Pinning in Flocking System with Discrete Symmetry},
author = {Chul-Ung Woo and Jae Dong Noh},
journal= {arXiv preprint arXiv:2403.10106},
year = {2026}
}
备注
8 pages with 4 figures. Supplementary videos may be available upon request