听声以窥未来:音视频第一人称视线预测
计算机视觉与模式识别
2024-03-25 v3
摘要
第一人称视线预测是增强现实新兴能力的关键基石。值得注意的是,在日常活动中,视线行为由视觉线索和音频信号共同驱动。受此观察启发,我们提出了首个利用视频与音频两种模态进行第一人称视线预测的模型。具体而言,我们提出一种对比时空可分(CSTS)融合方法,采用两个模块分别在空间和时间维度上捕捉音视频相关性,并对融合模块中重加权的音视频特征施加对比损失以进行表征学习。我们使用两个第一人称视频数据集 Ego4D 和 Aria 进行了大量消融研究与深入分析,以验证我们的模型设计。我们证明音频在这两个数据集上分别将性能提升了 +2.5% 和 +2.4%。我们的模型也以至少 +1.9% 和 +1.6% 的优势优于先前的最先进方法。此外,我们提供了可视化以展示视线预测结果,并对音视频表征学习给出额外见解。代码与数据划分已发布于我们的网站(https://bolinlai.github.io/CSTS-EgoGazeAnticipation/)。
引用
@article{arxiv.2305.03907,
title = {Listen to Look into the Future: Audio-Visual Egocentric Gaze Anticipation},
author = {Bolin Lai and Fiona Ryan and Wenqi Jia and Miao Liu and James M. Rehg},
journal= {arXiv preprint arXiv:2305.03907},
year = {2024}
}
备注
30 pages