真实的眼睛更快实现:以注视稳定性和瞳孔新颖性实现高效的环视学习
计算机视觉与模式识别
2026-03-05 v1 人机交互
摘要
始终开启的环视相机日益增多地用作具身机器人、仿真学习和辅助 AR 的演示,但所得视频流被冗余和低质量帧所主导。在可穿戴设备的存储和电池限制下,选择保留哪些帧与如何从中学习同样重要。我们观察到,现代眼动头戴设备提供一种无需训练的连续侧信道,可分为两个互补轴:注视固定捕捉视觉稳定性(质量),而瞳孔反应捕捉与唤��相关的时刻(新颖性)。我们将这一洞见具体化为双准则帧策展者,首先通过注视质量对帧进行门控,然后按瞳孔派生的新颖性对存活者进行排序。在 Visual Experience Dataset (VEDB) 上,处置 10% 预算下的帧与完整数据流的分类性能相当,而朴素的信号融合则持续破坏两者的贡献。该益处取决于任务:瞳孔排序改善活动识别,而仅依据注视的选择已占据场景识别的主导地位,确认这两类信号在本质上服从不同角色。该方法无需模型推理,能在捕获时运行,为实现高效、始终开启的环视数据策展提供了一条路径。
引用
@article{arxiv.2603.04098,
title = {Real Eyes Realize Faster: Gaze Stability and Pupil Novelty for Efficient Egocentric Learning},
author = {Ajan Subramanian and Sumukh Bettadapura and Rohan Sathish},
journal= {arXiv preprint arXiv:2603.04098},
year = {2026}
}
备注
14 pages, 4 figures, 3 tables, plus supplementary material