多模态大语言模型在活动辅助中的用户闭环评估
计算机视觉与模式识别
2024-08-14 v2 人工智能
摘要
本研究调查了由大语言模型(LLMs)驱动的现代多模态推理模型在辅助多步骤日常活动方面的能力。此类助手必须能够1)编码来自助手传感器(如摄像头)的相关视觉历史,2)预测完成活动所需的未来动作,以及3)根据用户闭环进行重新规划。为了评估前两项能力——视觉历史的锚定和短 horizons 与长 horizons 中的预测——我们在基于视频的动作预测任务上对两类突出的多模态LLM方法——苏格拉底模型和视觉条件语言模型(VCLMs)——进行了基准测试。这些离线基准测试不允许我们与用户闭环,而这是评估重新规划能力和衡量辅助场景中活动成功完成所必需的。为此,我们进行了一项首创的用户研究,18名参与者佩戴名为Aria的自我中心观测设备,执行3种不同的多步骤烹饪活动,并遵循多模态LLM的辅助。我们发现苏格拉底方法在离线和在线设置中均优于VCLMs。我们进一步指出,锚定长视觉历史(活动辅助中常见)在当前模型中仍然具有挑战性,尤其是对VCLMs而言,并且离线指标不能指示在线性能。
引用
@article{arxiv.2408.03160,
title = {User-in-the-loop Evaluation of Multimodal LLMs for Activity Assistance},
author = {Mrinal Verghese and Brian Chen and Hamid Eghbalzadeh and Tushar Nagarajan and Ruta Desai},
journal= {arXiv preprint arXiv:2408.03160},
year = {2024}
}
备注
9 pages, 4 figures