中文

STHG:用于先进音视频日记化的时空异质图学习

计算机视觉与模式识别 2023-11-02 v4 声音 音频与语音处理

摘要

本报告介绍了我们用于 Ego4D Challenge 2023 音视频日记化(Audio-Visual Diarization)任务的新方法 STHG。我们的关键创新在于使用单一、统一的异质图学习框架对视频中所有说话人进行建模。与以往需要单独组件仅用于佩戴摄像头者的方法不同,STHG 可联合检测包括佩戴摄像头者在内的所有人员的语音活动。我们的最终方法在 Ego4D 测试集上取得 61.1% 的 DER,显著优于所有基线及去年冠军。我们的提交在 Ego4D Challenge 2023 中获得第一名。我们还额外证明,将现成语音识别系统应用于 STHG 日记化出的语音段,可在此挑战的语音转写任务上取得有竞争力的性能。

关键词

引用

@article{arxiv.2306.10608,
  title  = {STHG: Spatial-Temporal Heterogeneous Graph Learning for Advanced Audio-Visual Diarization},
  author = {Kyle Min},
  journal= {arXiv preprint arXiv:2306.10608},
  year   = {2023}
}

备注

Validation report for the Ego4D challenge at CVPR 2023