音视频对话图:从自我中心到外部视角
计算机视觉与模式识别
2024-04-04 v2
摘要
近年来,与自我中心视频相关的研究蓬勃发展,为对话互动的研究提供了独特的视角,其中视觉和音频信号都起着至关重要的作用。虽然大多数先前的工作侧重于学习直接涉及相机佩戴者的行为,但我们引入了自我-外部对话图预测问题,标志着首次尝试从自我中心视频推断外部对话互动。我们提出了一个统一的多模态框架——音视频对话注意力,用于联合预测对话行为——说话和倾听——既包括相机佩戴者,也包括自我中心视频中出现的所有其他社交伙伴。具体来说,我们采用自注意力机制来建模跨时间、跨主体和跨模态的表示。为了验证我们的方法,我们在一个具有挑战性的自我中心视频数据集上进行了实验,该数据集包含多说话人和多对话场景。我们的结果表明,我们的方法相比一系列基线方法具有优越的性能。我们还提供了详细的消融研究,以评估模型中每个组件的贡献。请访问我们的项目页面:https://vjwq.github.io/AV-CONV/。
引用
@article{arxiv.2312.12870,
title = {The Audio-Visual Conversational Graph: From an Egocentric-Exocentric Perspective},
author = {Wenqi Jia and Miao Liu and Hao Jiang and Ishwarya Ananthabhotla and James M. Rehg and Vamsi Krishna Ithapu and Ruohan Gao},
journal= {arXiv preprint arXiv:2312.12870},
year = {2024}
}