面向理解恐惧表达的基于视觉语言模型驱动的鼠类行为提取的初步应用
机器学习
2025-10-23 v1
摘要
整合多样化数据将是提高众多学科科学探索的关键步骤。本工作建立了一个视觉-语言模型(VLM),该模型以文本输入对视频进行编码,以对 mouse 存在于其环境中并与之互动的各种行为进行分类。重要的是,该模型为每个 subject 以及每个 session(实验场合)在时间上的每个点上产生行为向量。该输出是少数程序能够以如此高的准确率并以最小的用户输入产生的数据。具体而言,我们使用开源的 Qwen2.5-VL 模型,并通过提示、基于标签示例的 in-context 学习(ICL)以及帧级预处理来提升其性能。我们发现,这些方法每一种都有助于改进分类,该模型在所有行为中实现了强大的 F1 分数,包括像 freezing 和 fleeing 这样稀有的类别,且无需任何模型微调。总体而言,本模型将支持研究 mouse 行为的跨学科研究人员,通过使其能够将跨多个时间点和环境中测量的各种行为特征整合到一个综合数据集中,以解决复杂的研究问题。
关键词
引用
@article{arxiv.2510.19160,
title = {Preliminary Use of Vision Language Model Driven Extraction of Mouse Behavior Towards Understanding Fear Expression},
author = {Paimon Goulart and Jordan Steinhauser and Kylene Shuler and Edward Korzus and Jia Chen and Evangelos E. Papalexakis},
journal= {arXiv preprint arXiv:2510.19160},
year = {2025}
}