GazeMind:面向个性化认知负荷评估的注视引导型大语言模型智能体
人机交互
2026-05-08 v1
摘要
随着集成 AI 助手的智能眼镜在日常生活中的广泛应用,当前系统仍缺乏对用户内在认知状态的感知,导致无法在缺乏认知负荷信息的情况下主动预测用户需求。现有认知负荷评估方法要么依赖轻量级眼镜不实用的传感器,要么采用基于注视的模型,后者解释性差且需要针对具体任务进行微调,往往难以跨个体泛化。我们提出 GazeMind,一个面向智能眼镜的注视引导型大语言模型(LLM)框架,用于认知负荷评估。它将眼动数据编码为结构化表示,以支持基于 LLM 的推理,并提供可解释的认知负荷预测。重要的是,GazeMind 通过一种新颖的任务指导推理方法实现无需 LLM 微调的跨场景泛化,并通过融合用户特定特征和历史参考实现个性化适应。为支持评估,我们引入 CogLoad-Bench,目前规模最大的基于注视的认知负荷数据集,包含 152 名参与者、40 小时以上的多模态数据,以及 10K 条跨受控与真实世界任务的实时标注。实验表明,GazeMind 在所有指标上均实现最先进性能,相较于基线方法提升超过 20%。
引用
@article{arxiv.2605.05790,
title = {GazeMind: A Gaze-Guided LLM Agent for Personalized Cognitive Load Assessment},
author = {Bin Wang and Yue Liu and Benjamin Newman and Ajoy S. Fernandes and Zhiyuan Wang and Robert Cavin and Michele A. Cox and Vijay Rajanna and Takumi Bolte and Melissa Hunfalvay and Ulas Bagci and Michael J. Proulx},
journal= {arXiv preprint arXiv:2605.05790},
year = {2026}
}