中文

关于肢体语言检测项目的架构主导混合报告

计算机视觉与模式识别 2025-12-30 v1 人工智能 软件工程

摘要

本报告对两种现代视觉-语言模型 (VLMs) Qwen2.5-VL-7B-Instruct 和 Llama-4-Scout-17B-16E-Instruct 进行了架构主导的分析,并解释了它们的架构特性如何映射到在 BodyLanguageDetection 仓库 [1] 中实现的实用视频到制品流水线。该系统对视频帧进行采样,提示 VLM 检测可见人员并生成带有提示条件属性(默认为情感)的像素空间边界框,使用预定义模式验证输出结构,并可选地渲染标注视频。我们首先总结了共享的多模态基础(视觉 token 化、Transformer 注意力机制和指令遵循),然后描述了每种架构的细节,其详细程度足以证明工程选择的合理性,而无需推测其内部结构。最后,我们将模型行为与系统约束联系起来:结构化输出可能在语法上有效但在语义上不正确,模式验证是结构性的(而非几何正确性),在当前的提示约定中人员标识符是帧局部的,而交互式单帧分析返回自由格式文本而非模式强制的 JSON。这些区别对于撰写可辩护的声明、设计稳健的接口以及规划评估至关重要。

关键词

引用

@article{arxiv.2512.23028,
  title  = {An Architecture-Led Hybrid Report on Body Language Detection Project},
  author = {Thomson Tong and Diba Darooneh},
  journal= {arXiv preprint arXiv:2512.23028},
  year   = {2025}
}