中文

从指令到帮助:一个将指令手册与装配视频对齐的数据集,用于评估多模态 LLM

计算机视觉与模式识别 2026-03-25 v1 人工智能 计算与语言

摘要

大型语言模型(LLM)的近期进步已彻底改变了人工智能(AI)如何支持复杂现实任务的方式,推动了研究走出文本边界,朝向多模态情境发展,导致多模态大型语言模型(MLMs)的出现。鉴于当前 LLM 基于助手在解决技术或领域特定问题时已被广泛采用,延续这一趋势的自然方向是扩展这些助手的输入领域,利用 MLMs。理想情况下,这些 MLMs 应被用作程序任务的实时助手,幸福地集成用户所在环境的视图,甚至更好的是通过虚拟现实(VR)或增强现实(AR)支持,与用户体验相同的视角,以推理其正在体验的情景。为评估当前可公开获取的 MLMs 在技术任务中提供此类帮助的质量,我们标注了一个家具装配数据集,包含逐步标签和手动参考:Manual to Action Dataset(M2AD)。我们使用该数据集来评估(1)MLMs 的推理能力是否可以减少对详细标注的需求,从而实现更高效、更具成本效益的标注实践;(2)MLMs 是否能够跟踪装配步骤的进展;(3)MLMs 是否能够正确引用说明书页面。我们的结果显示,尽管某些模型理解程序序列,但其性能受到架构和硬件约束的限制,这凸显了需要多图像和交错文本图像推理的需求。

关键词

引用

@article{arxiv.2603.22321,
  title  = {From Instructions to Assistance: a Dataset Aligning Instruction Manuals with Assembly Videos for Evaluating Multimodal LLMs},
  author = {Federico Toschi and Nicolò Brunello and Andrea Sassella and Vincenzo Scotti and Mark James Carman},
  journal= {arXiv preprint arXiv:2603.22321},
  year   = {2026}
}