中文

ViCocktail:面向越南语音觉语识别的自动化多模态数据收集

计算与语言 2025-06-06 v1 计算机视觉与模式识别

摘要

音视频语音识别(AVSR)近期因其对噪声鲁棒性优势而受到广泛关注,这种优势常常挑战仅依赖音频特征的常规语音识别系统。尽管如此,AVSR 模型仍受限于数据集稀缺,尤其是除英语外大多数语言。自动化数据收集提供了可行方案。本 work 提出一种实用方法,从原始视频中生成 AVSR 数据集,优化现有技术以提升效率与可达性。我们通过开发越南语的基线 AVSR 模型,展示其广泛适用性。实验表明,自动收集的数据集可实现强基线,干净环境下与 robust ASR 相当,在鸡尾酒会等嘈杂环境下显著超越。该高效方法为扩展更多语言的 AVSR 提供了路径,尤其是资源匮乏的语言。

关键词

引用

@article{arxiv.2506.04635,
  title  = {ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition},
  author = {Thai-Binh Nguyen and Thi Van Nguyen and Quoc Truong Do and Chi Mai Luong},
  journal= {arXiv preprint arXiv:2506.04635},
  year   = {2025}
}

备注

Accepted at Interspeech 2025