面向缺失情境的视频增强多模态不连贯检测
计算与语言
2024-06-12 v1 多媒体
声音
音频与语音处理
摘要
现有大多数语音不连贯检测技术仅依赖语音数据。本文提出一种实用的多模态不连贯检测方法,利用可用的视频数据与音频数据相结合。我们构建了音视频数据集,提出了一种新颖的融合技术,采用统一的权重共享模态无关编码器,以学习时序和语义上下文。我们的鲁棒设计适用于推理期间视频模态可能偶尔缺失的实际场景。我们还在两种模态均完整保证时提供替代融合策略。在五个不连贯检测任务实验中,我们的统一多模态方法显著优于仅依赖音频的单模态方法,在两种模态始终可用时平均提升10个百分点,在视频模态在一半样本中缺失时提升7个百分点。
引用
@article{arxiv.2406.06964,
title = {Missingness-resilient Video-enhanced Multimodal Disfluency Detection},
author = {Payal Mohapatra and Shamika Likhite and Subrata Biswas and Bashima Islam and Qi Zhu},
journal= {arXiv preprint arXiv:2406.06964},
year = {2024}
}
备注
Accepted to Interspeech 2024