中文

从第三人称视角视频中识别对话伙伴

计算机视觉与模式识别 2024-06-13 v1

摘要

在嘈杂的多说话者环境中进行沟通颇具挑战,尤其对于听力受损者更是如此。第三人称视角视频数据可用于识别用户对话的伙伴,这些信息可用于指导相关说话者的选择性声学放大。近期在计算机视觉领域引入的数据集和任务使进展 towards analyzing social interactions from an egocentric perspective 成为可能。基于此,我们聚焦于从第三人称视角视频中识别对话伙伴的任务,并描述了一个合适的数据集。该数据集包含69小时的第三人称视角视频,涵盖多样化的多对话场景,其中每个个体被指派一个或多个对话伙伴,为计算机视觉任务提供标签。该数据集促进了用于识别对话伙伴和评估相关方法的算法的开发和评估。本文描述了该数据集及其初始基线结果,这项正在进行的工作旨在为社交场景下的第三人称视角视频分析的激动人心的进展做出贡献。

关键词

引用

@article{arxiv.2406.08089,
  title  = {Identification of Conversation Partners from Egocentric Video},
  author = {Tobias Dorszewski and Søren A. Fuglsang and Jens Hjortkjær},
  journal= {arXiv preprint arXiv:2406.08089},
  year   = {2024}
}

备注

First Joint Egocentric Vision (EgoVis) Workshop at CVPR 2024