中文

CAD2DMD-SET:用于微调大视觉语言模型的数字测量设备 CAD 模型数据集的合成生成工具

计算机视觉与模式识别 2025-09-01 v1 人工智能

摘要

近期大型视觉语言模型(LVLMs)在 various 多模态任务中展现出惊人的能力,但在读取数字测量设备(DMDs)上仍表现不佳,尤其是在包括杂乱、遮挡、极端视角和运动模糊在内的真实场景中,这些场景常见于头戴式相机和增强现实(AR)应用中。为此,我们引入 CAD2DMD-SET,一个用于生成涵盖 DMDs 的 VQA 任务的合成数据的工具。该工具利用 3D CAD 模型、先进的渲染和高保真图像合成技术,产生多样且带有 VQA 标注的合成 DMD 数据集,适用于微调 LVLMs。此外,我们还构建了 DMDBench,即包含 1000 张标注好的真实图像的验证集,用于评估模型在实际约束下的性能。对三种最先进的 LVLMs 进行基准测试,使用平均归一化 Levenshtein 相似度(ANLS)进行评估,并通过 CAD2DMD-SET 生成的数据集对其 LoRA 进行微调,显著提升性能,其中 InternVL 的得分提升了 200%,且未损害其他任务。表明 CAD2DMD-SET 生成的训练数据在上述挑战性条件下显著提升了 LVLMs 的鲁棒性和性能。CAD2DMD-SET 工具预计将在最终版本稿件准备就绪后以开源形式发布,允许社区添加不同的测量设备并生成自己的数据集。

关键词

引用

@article{arxiv.2508.21732,
  title  = {CAD2DMD-SET: Synthetic Generation Tool of Digital Measurement Device CAD Model Datasets for fine-tuning Large Vision-Language Models},
  author = {João Valente and Atabak Dehban and Rodrigo Ventura},
  journal= {arXiv preprint arXiv:2508.21732},
  year   = {2025}
}