从野外视频中学习视频无关的眼神接触分割
计算机视觉与模式识别
2022-10-06 v1
摘要
人类眼神接触是一种非语言交流形式,对社会行为有很大影响。由于眼神接触目标在不同视频中的位置和大小各异,学习一个通用的视频无关眼神接触检测器仍是一项具有挑战性的任务。在本工作中,我们解决野外视频中的单向眼神接触检测任务。我们的目标是构建一个统一模型,能够识别在任意输入视频中一个人何时正在注视其注视目标。考虑到这需要时间序列的相对眼动信息,我们提议将该任务表述为一种时间分割。由于标注训练数据的稀缺,我们进一步提出一种注视目标发现方法,为未标注视频生成伪标签,这使得我们能够利用野外视频以无监督方式训练一个通用的眼神接触分割模型。为评估我们所提出的方法,我们手动标注了一个由52段人类对话视频组成的测试数据集。实验结果表明,我们的眼神接触分割模型优于先前的视频相关眼神接触检测器,并且在我们标注的测试集上可达到71.88%的逐帧准确率。我们的代码和评估数据集可在 https://github.com/ut-vision/Video-Independent-ECS 获取。
引用
@article{arxiv.2210.02033,
title = {Learning Video-independent Eye Contact Segmentation from In-the-Wild Videos},
author = {Tianyi Wu and Yusuke Sugano},
journal= {arXiv preprint arXiv:2210.02033},
year = {2022}
}
备注
Accepted to ACCV2022