中文

GAZE: 面向零样本世界模型环境的治理感知预标注

计算机视觉与模式识别 2025-10-20 v1 人工智能

摘要

训练健壮的世界模型需要大规模、精确标注的多模态数据集,这一过程历史上受限于缓慢且昂贵的手动标注。我们提出了一个经过验证的 GAZE 管道,自动将原始长视频转换为面向世界模型训练的丰富、任务就绪监督信号。该系统(i)将专有 360 度格式标准化为普通视图并进行分片以实现并行处理;(ii)应用一套 AI 模型(场景理解、目标跟踪、音频转录、PII/NSFW/未成年人检测)进行密集的多模态预标注;(iii)将信号整合为结构化输出规范,以实现快速的人类验证。GAZE 工作流程显著提升了效率(每小时节省约 19 分钟),通过保守的自动跳过低重要性片段将人类审核量降低 80%以上。通过提高标签密度和一致性,同时集成隐私保护和链式管道元数据,本方法生成高保真度、隐私感知的数据集,可直接用于学习跨模态动态和动作条件预测。我们详细阐述了编排、模型选择和数据字典,以提供一种可扩展的蓝图,用于在不牺牲吞吐量或治理方面的生成高质量世界模型训练数据。

关键词

引用

@article{arxiv.2510.14992,
  title  = {GAZE:Governance-Aware pre-annotation for Zero-shot World Model Environments},
  author = {Leela Krishna and Mengyang Zhao and Saicharithreddy Pasula and Harshit Rajgarhia and Abhishek Mukherji},
  journal= {arXiv preprint arXiv:2510.14992},
  year   = {2025}
}