中文

LIP-RTVE:一个面向真实场景下连续西班牙语的视听数据库

计算机视觉与模式识别 2023-11-22 v1 计算与语言

摘要

言语被认为是一个多模态过程,听觉与视觉是其中的两大基本支柱。事实上,多项研究已表明,当音频与视觉线索结合以表征言语本质时,自动语音识别系统的鲁棒性可得到提升。此外,视觉语音识别——这一旨在通过读取说话者唇部动作来解读言语的开放性研究问题——在过去几十年中一直是关注焦点。然而,为了在当前的深度学习时代对这些系统进行估计,需要大规模数据库。另一方面,尽管此类数据库大多面向英语,其他语言仍缺乏充足资源。因此,本文提出一个半自动标注的视听数据库,用于处理无约束的自然西班牙语,提供从西班牙电视节目中提取的13小时数据。进一步地,使用隐马尔可夫模型(该领域广泛使用的传统范式)给出了说话人相关与说话人无关场景下的基线结果。

关键词

引用

@article{arxiv.2311.12457,
  title  = {LIP-RTVE: An Audiovisual Database for Continuous Spanish in the Wild},
  author = {David Gimeno-Gómez and Carlos-D. Martínez-Hinarejos},
  journal= {arXiv preprint arXiv:2311.12457},
  year   = {2023}
}

备注

Accepted in Proceedings of LREC 2022 ( https://aclanthology.org/2022.lrec-1.294 )