中文

自然场景下的阅读识别

计算机视觉与模式识别 2026-05-01 v6 机器学习

摘要

为了在始终开启的智能眼镜中实现以自我为中心的情境 AI,记录用户与世界的交互(包括阅读过程)至关重要。在本文中,我们引入了阅读识别这一新任务,旨在确定用户何时正在阅读。我们首先介绍了首个大规模多模态的自然场景阅读数据集,其中包含 100 小时在多样且真实的场景下的阅读与非阅读视频。然后,我们确定了可用于解决该任务的三种模态(以自我为中心的 RGB、眼动注视、头部姿态),并提出了一种灵活的 Transformer 模型,该模型可以单独或组合使用这些模态来执行任务。我们表明这些模态与该任务相关且互补,并研究了如何高效且有效地编码每种模态。此外,我们展示了该数据集在阅读类型分类方面的有用性,将当前在受限环境下进行的阅读理解研究扩展到更大规模、更多样和更真实的场景。

关键词

引用

@article{arxiv.2505.24848,
  title  = {Reading Recognition in the Wild},
  author = {Charig Yang and Samiul Alam and Shakhrul Iman Siam and Michael J. Proulx and Lambert Mathias and Kiran Somasundaram and Luis Pesqueira and James Fort and Sheroze Sheriffdeen and Omkar Parkhi and Carl Ren and Mi Zhang and Yuning Chai and Richard Newcombe and Hyo Jin Kim},
  journal= {arXiv preprint arXiv:2505.24848},
  year   = {2026}
}

备注

NeurIPS 2025. Project Page: https://www.projectaria.com/datasets/reading-in-the-wild/