视觉语言模型跨表征装配指令对齐的基准测试与机制分析
计算机视觉与模式识别
2026-05-28 v2 计算与语言
摘要
二维装配图通常抽象且难以遵循,亟需能够监控进度、检测错误并提供逐步指导的智能助手。在混合现实环境中,此类系统必须从摄像头画面中识别已完成和进行中的步骤,并将其与图示指令对齐。视觉语言模型(VLMs)对此任务展现出潜力,但面临表征差距,因为装配图与视频帧共享的视觉特征极少。为系统评估这一差距,我们构建了IKEA-Bench,一个涵盖29款宜家家具产品、6种任务类型共1,623个问题的基准,并在三种对齐策略下评估了19个VLMs(2B-38B参数)。我们的关键发现:(1)装配指令理解可通过文本恢复,但文本同时会削弱图示到视频的对齐;(2)架构族比参数数量更能预测对齐准确率;(3)视频理解仍然是一个难以突破的瓶颈,不受策略影响。三级机制分析进一步揭示,图示与视频占据不相交的ViT子空间,且添加文本会使模型从视觉驱动推理转向文本驱动推理。这些结果表明视觉编码是提升跨表征鲁棒性的主要目标。项目页面:https://ryenhails.github.io/IKEA-Bench/
引用
@article{arxiv.2604.00913,
title = {Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment},
author = {Zhuchenyang Liu and Yao Zhang and Yu Xiao},
journal= {arXiv preprint arXiv:2604.00913},
year = {2026}
}