中文

DocTrack:一个真正与人类眼动对齐的富视觉文档数据集用于机器阅读

人机交互 2023-10-24 v1 计算机视觉与模式识别 信息检索

摘要

富视觉文档(VRDs)在各领域的应用产生了对能够像人类一样阅读和理解文档的文档 AI 模型的需求,这需要克服技术、语言和认知障碍。遗憾的是,适当数据集的缺乏显著阻碍了该领域的进展。为解决此问题,我们引入 \textsc{DocTrack},一个利用眼动追踪技术真正与人类眼动信息对齐的 VRD 数据集。该数据集可用于研究上述挑战。此外,我们探究了人类阅读顺序对文档理解任务的影响,并考察若机器以与人类相同的顺序阅读会发生什么。我们的结果表明,尽管文档 AI 模型已取得显著进展,但要像人类那样准确、连续且灵活地阅读 VRDs,仍有很长的路要走。这些发现对文档 AI 模型未来的研究与开发具有潜在意义。数据可在 \url{https://github.com/hint-lab/doctrack} 获取。

关键词

引用

@article{arxiv.2310.14802,
  title  = {DocTrack: A Visually-Rich Document Dataset Really Aligned with Human Eye Movement for Machine Reading},
  author = {Hao Wang and Qingxuan Wang and Yue Li and Changqing Wang and Chenhui Chu and Rui Wang},
  journal= {arXiv preprint arXiv:2310.14802},
  year   = {2023}
}

备注

14 pages, 8 figures, Accepted by Findings of EMNLP2023