中文

发言权:一种音视觉Transformer方法

计算机视觉与模式识别 2021-08-29 v1 声音 音频与语音处理

摘要

轮流发言在构建对话调控中起着至关重要的作用。识别主要说话人(正当地进行其发言轮次者)和打断者(正在打断或对主要说话人话语作出反应者)的任务仍然具有挑战性。尽管一些先前的方法已部分解决该任务,但仍存在一些局限。首先,音频与视觉特征的直接关联可能因模态不同而限制可提取的相关性。其次,跨时间片段、有助于维持定位、分离和对话上下文一致性的关系未被有效利用。最后,说话人之间通常包含对转向新说话人的追踪与预期决策的交互常被忽略。因此,本工作引入一种新的音视觉Transformer方法,用于解决在自然场景下多说话人对话视频的音视频双通道中主要说话人的定位与高亮问题。所提方法利用了视觉与音频信号中呈现的各类相关性。跨时空空间的时序音视觉关系通过Transformer结构中的自注意力机制被预期和优化。此外,引入了一个新收集的数据集用于主要说话人检测。据我们所知,这是能够自动在音视频双通道中定位并高亮多说话人对话视频中主要说话人的首批研究之一。

关键词

引用

@article{arxiv.2108.03256,
  title  = {The Right to Talk: An Audio-Visual Transformer Approach},
  author = {Thanh-Dat Truong and Chi Nhan Duong and The De Vu and Hoang Anh Pham and Bhiksha Raj and Ngan Le and Khoa Luu},
  journal= {arXiv preprint arXiv:2108.03256},
  year   = {2021}
}

备注

Accepted to ICCV 2021