中文

BehaviorVLM:基于视觉语言推理的统一无微调行为理解

计算机视觉与模式识别 2026-03-13 v1 人工智能

摘要

理解自由运动的动物行为是神经科学的核心任务,姿态估计与行为理解是将神经活动与自然动作关联的基础。然而,这两项任务仍严重依赖人工标注或不可靠的无监督流程,限制了可扩展性和可重复性。我们提出 BehaviorVLM,一个无需任务特定微调、最小人工标注的统一视觉语言框架,通过详细、明确且可验证的推理步骤引导预训练视觉语言模型(VLM)实现姿态估计和行为理解。对于姿态估计,我们利用量子点 grounding 的行为数据,提出多阶段管线集成时空、空间与跨视图推理。该设计大幅降低人工标注 effort,透视误差等几何检查暴露低置信度标签,生成的标签可后续过滤、纠正或用于微调下游姿态模型。对于行为理解,我们提出管线集成深度嵌入聚类实现过度分割行为发现、VLM 基于 per-clip 视频描述生成,以及 LLM 推理以合并和语义标记行为片段。行为管线可直接从视觉信息运行,无需关键点即可分割行为。这些组件共同实现了多动物行为的可扩展、可解释且标注轻的分析。

关键词

引用

@article{arxiv.2603.12176,
  title  = {BehaviorVLM: Unified Finetuning-Free Behavioral Understanding with Vision-Language Reasoning},
  author = {Jingyang Ke and Weihan Li and Amartya Pradhan and Jeffrey Markowitz and Anqi Wu},
  journal= {arXiv preprint arXiv:2603.12176},
  year   = {2026}
}