中文

面向缺失情境的视频增强多模态不连贯检测

计算与语言 2024-06-12 v1 多媒体 声音 音频与语音处理

摘要

现有大多数语音不连贯检测技术仅依赖语音数据。本文提出一种实用的多模态不连贯检测方法,利用可用的视频数据与音频数据相结合。我们构建了音视频数据集,提出了一种新颖的融合技术,采用统一的权重共享模态无关编码器,以学习时序和语义上下文。我们的鲁棒设计适用于推理期间视频模态可能偶尔缺失的实际场景。我们还在两种模态均完整保证时提供替代融合策略。在五个不连贯检测任务实验中,我们的统一多模态方法显著优于仅依赖音频的单模态方法,在两种模态始终可用时平均提升10个百分点,在视频模态在一半样本中缺失时提升7个百分点。

关键词

引用

@article{arxiv.2406.06964,
  title  = {Missingness-resilient Video-enhanced Multimodal Disfluency Detection},
  author = {Payal Mohapatra and Shamika Likhite and Subrata Biswas and Bashima Islam and Qi Zhu},
  journal= {arXiv preprint arXiv:2406.06964},
  year   = {2024}
}

备注

Accepted to Interspeech 2024