标注副驾驶:面向计算机视觉自动化数据策展的深度研究智能体
计算机视觉与模式识别
2025-09-29 v1 计算与语言
摘要
策展高质量、特定领域的数据集是部署鲁棒视觉系统的主要瓶颈,在研究海量无标签数据湖时需要在数据质量、多样性和成本之间进行复杂的权衡。我们引入了 Labeling Copilot,这是首个面向计算机视觉的数据策展深度研究智能体。一个由大型多模态语言模型驱动的中央编排智能体,使用多步推理在三个核心能力上执行专用工具:(1) 校准发现从大型存储库中获取相关的分布内数据;(2) 可控合成通过鲁棒过滤为罕见场景生成新数据;(3) 共识标注通过结合非极大值抑制和投票的新型共识机制来编排多个基础模型,从而生成准确的标签。我们的大规模验证证明了 Labeling Copilot 各组件的有效性。共识标注模块在目标发现方面表现出色:在密集的 COCO 数据集上,它平均每张图像生成 14.2 个候选提议——几乎是 7.4 个真实目标的两倍——最终实现了 37.1% 的标注 mAP。在网络规模的 Open Images 数据集上,它克服了极端的类别不平衡,发现了 903 个新的边界框类别,将其能力扩展到总计超过 1500 个类别。同时,我们的校准发现工具在千万样本规模下进行了测试,其主动学习策略在同等样本效率下,计算效率比替代方案高出 40 倍。这些实验验证了带有优化且可扩展工具的智能体工作流为策展工业规模数据集提供了鲁棒的基础。
引用
@article{arxiv.2509.22631,
title = {LABELING COPILOT: A Deep Research Agent for Automated Data Curation in Computer Vision},
author = {Debargha Ganguly and Sumit Kumar and Ishwar Balappanawar and Weicong Chen and Shashank Kambhatla and Srinivasan Iyengar and Shivkumar Kalyanaraman and Ponnurangam Kumaraguru and Vipin Chaudhary},
journal= {arXiv preprint arXiv:2509.22631},
year = {2025}
}