VIALM:基于大模型的视障辅助综述与基准测试
计算与语言
2024-02-13 v2 人工智能
计算机视觉与模式识别
摘要
视障辅助(VIA)旨在自动帮助视障人士(VI)处理日常活动。VIA 的进步主要依赖于计算机视觉(CV)和自然语言处理(NLP)的发展,这两者均展现了基于大模型(LMs)的最先进范式。此外,LMs 已展现出卓越的多模态能力,以解决具身机器人等具有挑战性的物理接地任务。为了调查最先进(SOTA)LMs 在 VIA 应用中的潜力和局限性,我们针对使用 LMs 进行 VIA 的任务(VIALM)提出了一项广泛研究。在该任务中,给定一张说明物理环境的图像和来自 VI 用户的语言请求,VIALM 旨在输出逐步指导,以协助 VI 用户在环境中完成请求。该研究包括一篇回顾近期 LM 研究的综述,以及检验选定 LMs 在 VIA 中能力的基准实验。结果表明,虽然 LMs 可能有益于 VIA,但其输出无法很好地与环境接地(即 GPT-4 的回应中仅有 25.7%),且缺乏细粒度指导(即 GPT-4 的回应中仅有 32.1%)。
引用
@article{arxiv.2402.01735,
title = {VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models},
author = {Yi Zhao and Yilin Zhang and Rong Xiang and Jing Li and Hillming Li},
journal= {arXiv preprint arXiv:2402.01735},
year = {2024}
}
备注
under review