中文

GazeLLM: 融合人类视觉注意力的多模态大语言模型

人机交互 2025-04-09 v1 人工智能 计算机视觉与模式识别

摘要

大型语言模型(LLMs)正在向多模态大语言模型(MLLMs)发展,能够处理图像、音频和视频以及文本。将一线视频与 MLLMs 结合,显示出巨大的潜力,用于通过视频和音频理解人类活动,支持许多人机交互和人类增强应用,如人类活动支持、实时智能体和技能转移到机器人或其他个人。然而,处理高分辨率、长时长视频会生成大量潜在表示,导致巨大的内存和计算需求,限制了 MLLMs 能处理的视频长度和分辨率。降低视频分辨率可降低内存使用,但常常损害理解效果。本文提出一种方法,通过整合眼动追踪数据优化一线视频分析,提出一种将一线视觉视频分解为注视区域子区域的方法。通过处理这些 selectively gazed-focused 输入,我们的做法在显著降低视频数据输入(像素数量减少至十分之一)的同时,实现了与在全分辨率下处理整个图像等甚至更好的任务理解能力,为使用 MLLMs 解释和利用人类技能提供了高效解决方案。

关键词

引用

@article{arxiv.2504.00221,
  title  = {GazeLLM: Multimodal LLMs incorporating Human Visual Attention},
  author = {Jun Rekimoto},
  journal= {arXiv preprint arXiv:2504.00221},
  year   = {2025}
}