PerceptionLM:面向详细视觉理解的开放数据与模型
计算机视觉与模式识别
2025-07-25 v3 人工智能
机器学习
摘要
视觉-语言模型是计算机视觉研究的核心组件,但许多高性能模型仍为闭源,其数据、设计和训练配方不为人知。研究社区通过从黑箱模型蒸馏来标记训练数据,以取得强劲的基准结果,但代价是可衡量的科学进展。然而,在不了解教师模型及其数据来源细节的情况下,科学进展仍难以衡量。本文我们研究在完全开放和可复现的框架下构建感知语言模型(PLM),以实现图像和视频理解的透明研究。我们分析了在不来自专有模型的蒸馏的情况下的标准训练管道,并探索大规模合成数据以识别关键数据缺口,尤其是在详细的视频理解方面。为弥合这些缺口,我们发布了 280 万人工标注的细粒度视频问答对和时空导向视频标题。此外,我们引入 PLM-VideoBench,一个聚焦于推理“视频中发生了什么、在哪里、何时以及如何”能力的测试套件。我们通过提供数据、训练配方、代码和模型实现了本工作的完全可复现性。https://github.com/facebookresearch/perception_models
引用
@article{arxiv.2504.13180,
title = {PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding},
author = {Jang Hyun Cho and Andrea Madotto and Effrosyni Mavroudi and Triantafyllos Afouras and Tushar Nagarajan and Muhammad Maaz and Yale Song and Tengyu Ma and Shuming Hu and Suyog Jain and Miguel Martin and Huiyu Wang and Hanoona Rasheed and Peize Sun and Po-Yao Huang and Daniel Bolya and Nikhila Ravi and Shashank Jain and Tammy Stark and Shane Moon and Babak Damavandi and Vivian Lee and Andrew Westbury and Salman Khan and Philipp Krähenbühl and Piotr Dollár and Lorenzo Torresani and Kristen Grauman and Christoph Feichtenhofer},
journal= {arXiv preprint arXiv:2504.13180},
year = {2025}
}
备注
Technical Report