看听:面向语音导向的人类注意力预测
计算机视觉与模式识别
2024-09-11 v2
摘要
对于计算机系统而言,若要有效地通过语音与人类交互,便需理解所生成的语言如何影响用户即时注意力。我们的研究聚焦于在人类观看图像并聆听描述性表达以定义应注视的场景中目标时,对注意力的增量预测。为预测此类增量对象指 referral 任务中的注视轨迹,我们开发了注意力导向转换器模型(Attention in Referral Transformer,ART),该模型预测由描述性表达中每个词所引发的注视。ART使用多模态转换器编码器联合学习注视行为及其底层任务,而使用自回归转换器解码器预测每个词基于注视历史所对应的可变数量的注视。为训练ART,我们创建了RefCOCO-Gaze数据集,包含19,738个人类注视轨迹,对应2,094个独特的图像-表达式对,来自220名参与者完成我们的指 referral 任务。在我们的定量和定性分析中,ART不仅在注视轨迹预测方面超越现有方法,还似乎捕捉到了人类注意力模式的多个方面,如等待、扫描和验证。
引用
@article{arxiv.2407.19605,
title = {Look Hear: Gaze Prediction for Speech-directed Human Attention},
author = {Sounak Mondal and Seoyoung Ahn and Zhibo Yang and Niranjan Balasubramanian and Dimitris Samaras and Gregory Zelinsky and Minh Hoai},
journal= {arXiv preprint arXiv:2407.19605},
year = {2024}
}
备注
Accepted for ECCV 2024