GazeXplain:学习预测自然语言视觉扫视路径解释
计算机视觉与模式识别
2024-08-07 v1
摘要
在探索视觉场景时,人类的扫视路径由其 underlying 注意力过程驱动。理解视觉扫视路径对于各种应用至关重要。传统的扫视路径模型在预测注视点和时间时不提供解释,导致无法理解注视背后理由的鸿沟。为填补这一鸿沟,我们引入GazeXplain,这是一种视觉扫视路径预测和解释的新研究。这涉及为注视在眼动数据集上标注自然语言解释,并提出一种通用模型,具有注意力-语言解码器,联合预测扫视路径并生成解释。它集成了独特的语义对齐机制以增强注视与解释之间的一致性,同时采用跨数据集 co-training 方法以实现泛化。这些新颖的做法为可解释的人类视觉扫视路径预测提供了全面且可适应的解决方案。广泛的实验在多样化的眼动数据集上表明,GazeXplain 在扫视路径预测和解释方面均有效,为人类视觉注意力和认知过程提供了宝贵的见解。
引用
@article{arxiv.2408.02788,
title = {GazeXplain: Learning to Predict Natural Language Explanations of Visual Scanpaths},
author = {Xianyu Chen and Ming Jiang and Qi Zhao},
journal= {arXiv preprint arXiv:2408.02788},
year = {2024}
}
备注
To appear in ECCV2024