用于以自我为中心的长期动作预测的意图引导认知推理
计算机视觉与模式识别
2025-11-18 v2 人工智能
摘要
从以自我为中心的视频中进行长期动作预测对于人机交互和辅助技术等应用至关重要,在这些应用中,预测用户意图能够实现主动且具备上下文感知的 AI 辅助。然而,现有方法存在三个关键局限性:1) 未充分利用来自手物交互的细粒度视觉线索,2) 忽视动词和名词之间的语义依赖性,以及 3) 缺乏显式的认知推理,限制了泛化和长期预测能力。为了克服这些挑战,我们提出了 INSIGHT,一个用于以自我为中心的动作预测的统一两阶段框架。在第一阶段,INSIGHT 专注于从手物交互区域提取语义丰富的特征,并使用动名词共现矩阵增强动作表示。在第二阶段,它引入了一个基于强化学习的模块,通过一个结构化的过程模拟显式的认知推理:视觉感知 -> 意图推断 -> 动作预测。在 Ego4D、EPIC-Kitchens-55 和 EGTEA Gaze+ 基准上的大量实验表明,INSIGHT 取得了 SOTA 性能,证明了其有效性和强大的泛化能力。
引用
@article{arxiv.2508.01742,
title = {Intention-Guided Cognitive Reasoning for Egocentric Long-Term Action Anticipation},
author = {Qiaohui Chu and Haoyu Zhang and Meng Liu and Yisen Feng and Haoxiang Shi and Liqiang Nie},
journal= {arXiv preprint arXiv:2508.01742},
year = {2025}
}
备注
Accepted by AAAI-2026