基于语言模型与合成数据的统一音视频语音识别与翻译方法——SynesLM
音频与语音处理
2024-08-02 v1 计算与语言
计算机视觉与模式识别
摘要
本文提出SynesLM,一个统一模型,可执行三项多模态语言理解任务:音视频自动语音识别(AV-ASR)和视觉辅助语音/机器翻译(VST/VMT)。不同于以嘴部运动作为视觉线索的前期研究,本工作探索整个画面中的更广泛视觉信息,如物体与动作。此外,我们使用合成图像数据以增强图像与语音数据之间的相关性。在How2数据集上对SynesLM进行基准测试,显示其在AV-ASR任务上的性能与专用SOTA模型持平,同时保持多任务框架。值得注意的是,SynesLM在零样态AV-ASR中实现了SOTA性能,将词错误率(WER)从43.4%降至39.4%。此外,我们在VST和VMT上的结果分别超越了之前结果,将BLEU分数提升至43.5(来自37.2)和54.8(来自54.4)。
引用
@article{arxiv.2408.00624,
title = {SynesLM: A Unified Approach for Audio-visual Speech Recognition and Translation via Language Model and Synthetic Data},
author = {Yichen Lu and Jiaqi Song and Xuankai Chang and Hengwei Bian and Soumi Maiti and Shinji Watanabe},
journal= {arXiv preprint arXiv:2408.00624},
year = {2024}
}