中文

GazeInterpreter:解析眼动以生成眼-体协调叙述

人机交互 2025-11-21 v1

摘要

全面解读人类行为是面向人类的人工智能的核心挑战。然而,先前研究通常聚焦于身体行为,忽视了眼动及其与身体运动协同的关键作用。我们提出GazeInterpreter——一种基于大语言模型(LLM-based)的创新方法,用于解析眼动数据并生成眼-体协调叙述。具体而言,我们的方法具有以下特征:1)一个符号化眼动解析器,将原始眼动信号转换为符号化眼动事件;2)一个层次化结构,首先使用LLM在语义层面生成眼动叙述,然后在同一观测窗口内将眼动与身体运动整合以产生综合叙述;3)一个自校正循环,迭代优化模态匹配、时间一致性和综合叙述的完整性。这种层次化和迭代处理可以有效对齐物理值与语义文本在时间和空间领域。我们在大型Nymeria基准测试的文本驱动运动生成任务上验证了眼-体协调叙述的有效性。此外,我们在动作预测和行为摘要等下游采样任务上报告了显著的性能提升。综上所述,这些结果揭示了解析眼动以解读人类行为的巨大潜力,并为人类行为理解开辟了新方向。

关键词

引用

@article{arxiv.2511.16245,
  title  = {GazeInterpreter: Parsing Eye Gaze to Generate Eye-Body-Coordinated Narrations},
  author = {Qing Chang and Zhiming Hu},
  journal= {arXiv preprint arXiv:2511.16245},
  year   = {2025}
}

备注

Accepted to AAAI 2026. 9 pages, 4 figures