ViCocktail:面向越南语音觉语识别的自动化多模态数据收集
计算与语言
2025-06-06 v1 计算机视觉与模式识别
摘要
音视频语音识别(AVSR)近期因其对噪声鲁棒性优势而受到广泛关注,这种优势常常挑战仅依赖音频特征的常规语音识别系统。尽管如此,AVSR 模型仍受限于数据集稀缺,尤其是除英语外大多数语言。自动化数据收集提供了可行方案。本 work 提出一种实用方法,从原始视频中生成 AVSR 数据集,优化现有技术以提升效率与可达性。我们通过开发越南语的基线 AVSR 模型,展示其广泛适用性。实验表明,自动收集的数据集可实现强基线,干净环境下与 robust ASR 相当,在鸡尾酒会等嘈杂环境下显著超越。该高效方法为扩展更多语言的 AVSR 提供了路径,尤其是资源匮乏的语言。
引用
@article{arxiv.2506.04635,
title = {ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition},
author = {Thai-Binh Nguyen and Thi Van Nguyen and Quoc Truong Do and Chi Mai Luong},
journal= {arXiv preprint arXiv:2506.04635},
year = {2025}
}
备注
Accepted at Interspeech 2025