通过语言引导的场景上下文感知学习实现稳健的轨迹外观视觉注意力预测
计算机视觉与模式识别
2026-01-06 v1
摘要
随着对轨迹视频分析需求的增长, 轨迹外观视觉注意力预测, 即预测摄像机佩戴者将注意何处, 正受到日益关注. 然而, 由于动态轨迹场景的内在复杂性和模糊性, 这仍然具有挑战性. 受场景上下文信息在调制人类注意力方面起关键作用的证据启发, 本文提出一种基于语言引导的场景上下文感知学习框架, 实现稳健的轨迹外观视觉注意力预测. 我们首先设计了一个情境感知器, 其根据语言基于场景描述的描述来总结轨迹视频, 生成情境感知的视频表示. 随后, 我们引入两个训练目标: 1) 鼓励框架聚焦于目标点-of-interest 区域; 2) 抑制来自不太可能吸引第一人称注意力的无关区域的干扰. 在 Ego4D 和 Aria Everyday Activities (AEA) 数据集上的大量实验表明, 我们方法的有效性, 实现了最先进的性能和在多样化、动态轨迹情景中的增强鲁棒性.
引用
@article{arxiv.2601.01818,
title = {Robust Egocentric Visual Attention Prediction Through Language-guided Scene Context-aware Learning},
author = {Sungjune Park and Hongda Mao and Qingshuang Chen and Yong Man Ro and Yelin Kim},
journal= {arXiv preprint arXiv:2601.01818},
year = {2026}
}
备注
11 pages, 7 figures, 4 tables