面向跨平台移动智能体的可扩展视频到数据集生成
计算机视觉与模式识别
2025-05-20 v1 人工智能
计算与语言
机器学习
摘要
近期大型语言模型(LLM)和视觉语言模型(VLM)的快速发展催生了开发 GUI 视觉智能体的浓厚兴趣。我们引入 MONDAY (Mobile OS Navigation Task Dataset for Agents from YouTube),一个来自 20 部 instructional 视频中 313K 个标注帧的大型数据集,捕捉了跨多个平台的多样化真实世界移动 OS 导航。包含 MONDAY 的模型在预训练阶段表现出鲁活加性强的跨平台泛化能力, consistently outperforming 基于单个 OS 数据集训练的模型,在未见的移动 OS 平台上实现平均性能提升 18.11%p。为支持随移动平台演化而持续扩充数据集,本文提出了自动化框架,利用公开的视频内容创建全面的任务数据集,无需手动标注。该框架包括基于 OCR 的鲁棒场景检测(95.04% F1分数)、接近完美的 UI 元素检测(99.87% 命中率)以及 novel 多步骤动作识别,以从多样化的界面配置中提取可靠的动作序列。我们贡献了 MONDAY 数据集和自动化收集框架,以促进未来在移动 OS 导航研究中的发展。
引用
@article{arxiv.2505.12632,
title = {Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents},
author = {Yunseok Jang and Yeda Song and Sungryull Sohn and Lajanugen Logeswaran and Tiange Luo and Dong-Ki Kim and Kyunghoon Bae and Honglak Lee},
journal= {arXiv preprint arXiv:2505.12632},
year = {2025}
}
备注
CVPR 2025