减少冗余性:提升视觉语言模型在步行助理中的实用性
计算与语言
2026-05-13 v4
摘要
全球约有 2.83 亿人群体活跃视力受损,这激励着越来越多的研究致力于利用视觉语言模型(VLM)开发针对盲人和低视力人群的有效步行辅助系统。然而,现有步行助理任务中的 VLM 输出常包含大量冗余信息和不必要细节,严重影响用户准确判断周围环境的能力。此外,这些模型通常缺乏主动评估环境风险并根据恰当场景自适应触发提醒的能力,导致时序冗余过度。为缓解输出冗余和时序冗余,我们提出 WalkVLM-LR,这是一个冗余更少的步行助理模型。为减少输出冗余,我们在基于 GRPO 的推理框架中引入四个基于人类偏好的自定义奖励函数,以优化输出在简洁性、流畅性、关键词密度和准确性方面的表现,从而产生更具信息量且结构更简洁的输出。为最小化时序冗余,我们融合一种环境感知判别器,该判别器与 VLM 分享视觉编码器,以减少冗余计算并提升判别效率,使 WalkVLM-LR 能够评估场景风险水平并最小化不必要的提醒。实验结果表明,我们的方法在所有评估指标上均优于其他模型,尤其在输出简洁性和时序冗余降低方面表现突出。
引用
@article{arxiv.2508.16070,
title = {Less Redundancy: Boosting Practicality of Vision Language Model in Walking Assistants},
author = {Chongyang Li and Zhiqiang Yuan and Hanbo Bi and Zexi Jia and Jinchao Zhang},
journal= {arXiv preprint arXiv:2508.16070},
year = {2026}
}
备注
ICASSP 2026 Best Industry Paper