面向视觉受损者的场景感知向量化记忆多智能体框架与跨模态差异化量化 VLMs
人机交互
2025-08-26 v1
摘要
视觉受损个体面临环境感知的重大挑战。传统辅助技术往往缺乏自适应智能,关注单个组件而非集成系统。虽然视觉语言模型(VLMs)提供了实现更丰富整合理解的前景,但其部署受到巨大的计算要求限制,需要数十 gigabytes 的内存。为解决计算效率和集成设计之间的空白,本研究提出了双重技术创新框架:VLMs 的跨模态差异化量化框架和场景感知向量化记忆多智能体系统。该量化框架采用差异化策略,将内存从38GB 降至11.3GB。多智能体系统使用向量化记忆和感知-记忆-推理工作流程,提供当前视野之外的环境信息,实现2.83-3.52秒的初始语音输出延迟。实验表明,量化后的19B 参数模型在MMBench上仅出现2.05%性能下降,在OCR-VQA上保持63.7准确率(原64.9),超越等效内存的较小模型。该研究推进了计算效率和辅助技术,为场景感知、文本识别和导航提供了全面帮助。
引用
@article{arxiv.2508.18174,
title = {InReAcTable: LLM-Powered Interactive Visual Data Story Construction from Tabular Data},
author = {Gerile Aodeng and Guozheng Li and Yunshan Feng and Qiyang Chen and Yu Zhang and Chi Harold Liu},
journal= {arXiv preprint arXiv:2508.18174},
year = {2025}
}
备注
16 pages, 10 figures, accepted at ACM UIST 2025 (to appear)