VideoCAD:从视频中学习长时程 3D CAD UI 交互的数据集与模型
计算机视觉与模式识别
2025-11-11 v2 人工智能
摘要
计算机辅助设计(CAD)是一个耗时且复杂的过程,需要用户与复杂的 3D 界面进行精确的长时程交互。尽管近期 AI 驱动的用户界面(UI)智能体展现出潜力,但大多数现有数据集和方法侧重于移动或 Web 应用中简短、低复杂度的任务,未能捕捉专业工程工具的需求。在这项工作中,我们引入了 VideoCAD,这是对精密工程任务的 UI 交互进行建模的首次尝试。具体而言,VideoCAD 是一个大规模合成数据集,包含超过 41K 条带标注的 CAD 操作视频记录,这些记录是使用一个自动化框架从人工制作的 CAD 设计中收集高保真 UI 动作数据生成的。与现有数据集相比,VideoCAD 在真实工程 UI 任务的复杂性上提升了一个数量级,其时间跨度比其他数据集长 20 倍。我们展示了 VideoCAD 的两个重要下游应用:(1)从专业 3D CAD 工具中学习用于精密任务的 UI 交互,以及(2)一个视觉问答(VQA)基准,旨在评估多模态大语言模型在空间推理和视频理解方面的能力。为了学习 UI 交互,我们提出了 VideoCADFormer,这是一个直接从视频学习 CAD 交互的最先进模型,其表现优于现有的行为克隆基线。VideoCADFormer 和源自 VideoCAD 的 VQA 基准都揭示了当前基于视频的 UI 理解中的关键挑战,包括对精确动作定位、多模态和空间推理以及长时程依赖性的需求。
引用
@article{arxiv.2505.24838,
title = {VideoCAD: A Dataset and Model for Learning Long-Horizon 3D CAD UI Interactions from Video},
author = {Brandon Man and Ghadi Nehme and Md Ferdous Alam and Faez Ahmed},
journal= {arXiv preprint arXiv:2505.24838},
year = {2025}
}