TEXT2TASTE:一种基于大语言模型的多功能第一人称视觉智能阅读辅助系统
计算机视觉与模式识别
2024-04-16 v1
摘要
从书面文本中阅读、理解和查找重要信息是我们日常生活中一项关乎独立性、舒适度和安全性的关键技能。然而,社会中有相当一部分人受到部分视力障碍的影响,这导致他们在日常活动中感到不适并产生依赖性。为解决这部分人群的局限性,我们提出了一种基于智能眼镜的智能阅读助手,该眼镜嵌入了RGB摄像头并搭载大语言模型(LLM),其功能超越了矫正镜片。从佩戴者第一人称视角录制的视频经过处理,利用目标检测和光学字符识别方法定位文本信息。大语言模型处理这些数据,允许用户与文本进行交互并回应给定的查询,从而将矫正镜片的功能扩展到能够从文本中查找和总结知识。为评估我们的方法,我们创建了一个基于聊天的应用程序,允许用户与系统交互。评估在真实世界环境中进行,例如在餐厅阅读菜单,共有四名参与者。结果显示文本检索具有鲁棒的准确性。该系统不仅提供了准确的餐食建议,还获得了很高的用户满意度,凸显了智能眼镜和大语言模型在帮助有特殊需求人群方面的潜力。
引用
@article{arxiv.2404.09254,
title = {TEXT2TASTE: A Versatile Egocentric Vision System for Intelligent Reading Assistance Using Large Language Model},
author = {Wiktor Mucha and Florin Cuconasu and Naome A. Etori and Valia Kalokyri and Giovanni Trappolini},
journal= {arXiv preprint arXiv:2404.09254},
year = {2024}
}
备注
Accepted at ICCHP 2024