中文

用于从无标签原始视频中检索灵长类行为的视频-文本对比模型精细调优

计算机视觉与模式识别 2025-05-12 v1

摘要

野生环境中非人灵长类的视频记录是研究其行为的常见来源。我们针对单身猴子的特定领域,微调预训练的视频-文本基础模型,以开发有用的计算模型帮助研究人员从视频中检索有用的片段。我们聚焦于仅使用原始无标签视频素材(以及来自现场合作者有时提供的弱音频描述)进行模型训练的挑战性问题。我们利用最近在多模态大语言模型(MLLMs)和视觉-语言模型(VLMs)方面的最新进展来应对视频和音频内容的极度噪声问题。具体而言,我们提出了两种方法:一个代理数据处理管道和一个精细调优过程。数据处理管道自动从原始视频中提取干净且语义对齐的视频-文本对,这些对随后用于通过低秩适应(LoRA)微调预训练的Microsoft X-CLIP模型。我们在领域数据上实现了16帧模型的 167%167\% 点击率提升,8帧模型的 114%114\% 提升。此外,基于 NDCG@KNDCG@K 结果,我们的模型能够良好地排序大多数考虑的行为,而测试的原始预训练模型则完全无法对它们进行排序。代码将在接受后公开。

关键词

引用

@article{arxiv.2505.05681,
  title  = {Fine-Tuning Video-Text Contrastive Model for Primate Behavior Retrieval from Unlabeled Raw Videos},
  author = {Giulio Cesare Mastrocinque Santo and Patrícia Izar and Irene Delval and Victor de Napole Gregolin and Nina S. T. Hirata},
  journal= {arXiv preprint arXiv:2505.05681},
  year   = {2025}
}