可解释卷积 SyncNet
计算机视觉与模式识别
2024-09-05 v1 多媒体
声音
音频与语音处理
摘要
由于野生视频可能因各种原因而不同步,sync-net 用于将视频恢复同步,以满足需要同步视频的任务。以往的领先 sync-net 使用 InfoNCE loss,依赖 transformer 架构,或两者兼有。不幸的是,前者使模型输出难以解释,后者不利于大图像,从而限制了 sync-net 的实用性。在本工作中,我们使用基于平衡 BCE loss(BBCE)——该损失灵感来自二进制交叉熵(BCE)和 InfoNCE losses 的 BBCE 损失——训练卷积 sync-net。与 InfoNCE loss 不同,BBCE loss 不需要复杂的抽样方案。我们的模型能更好地处理大图像,其输出可给出概率解释。概率解释允许我们定义诸如概率偏移量和离屏比率等指标来评估音频-视觉(AV)语音数据集的同步质量。此外,我们的模型在 LRS2 数据集上实现了 的最高准确率,在 LRS3 数据集上实现了 的准确率。
引用
@article{arxiv.2409.00971,
title = {Interpretable Convolutional SyncNet},
author = {Sungjoon Park and Jaesub Yun and Donggeon Lee and Minsik Park},
journal= {arXiv preprint arXiv:2409.00971},
year = {2024}
}
备注
8+5 pages