中文

TriBERT:用于视觉声音分离的全身体中心视听表征学习

计算机视觉与模式识别 2021-10-27 v1

摘要

近期诸如 BERT 等语言 transformer 模型的成功推动了此类架构在多模态特征学习与任务中的应用。然而,大多数多模态变体(如 ViLBERT)仅限于视觉-语言数据。相对较少的工作探索了其在视听模态中的使用,且据我们所知,没有工作在细粒度视听检测或分割任务(如声源分离与定位)的背景下展示它们。在本工作中,我们引入 TriBERT——一种受 ViLBERT 启发的基于 transformer 的架构,其利用灵活的协同注意力实现视觉、姿态和音频三种模态间的上下文特征学习。使用姿态关键点的灵感来自近期工作,这些工作表明此类表征能显著提升许多视听场景中的性能,其中往往有一个或多个人类显式(如说话)或隐式(如人类操纵物体所产生的声音)地产生声音。从技术角度,作为 TriBERT 架构的一部分,我们引入了一种基于空间注意力的可学习视觉分词方案,并利用弱监督来实现视觉与姿态模态间的细粒度跨模态交互。此外,我们通过跨三个流构建的声源分离损失来补充学习。我们在大型 MUSIC21 数据集上预训练模型,并通过微调展示了在该数据集及其他数据集上视听声源分离的改进性能。此外,我们表明学习到的 TriBERT 表征具有通用性,并显著提升了其他视听任务(如跨模态视听姿态检索)的性能,其 top-1 准确率提升高达 66.7%。

关键词

引用

@article{arxiv.2110.13412,
  title  = {TriBERT: Full-body Human-centric Audio-visual Representation Learning for Visual Sound Separation},
  author = {Tanzila Rahman and Mengyu Yang and Leonid Sigal},
  journal= {arXiv preprint arXiv:2110.13412},
  year   = {2021}
}

备注

10 pages, 5 Figures, Neurips 2021