Chinese-LiPS:一个包含口语和演示幻灯片的中文音视频语音识别数据集
多媒体
2025-04-22 v1 人工智能
摘要
将视觉模态纳入自动语音识别(ASR)任务已导致显著的性能提升。然而,现有的音视频语音识别(AVSR)数据集和方法通常仅依赖 lip-reading 信息或说话人语境视频,忽视了在说话语境中结合这些不同有价值视觉线索的潜力。本文发布了一个多模态中文AVSR数据集,Chinese-LiPS,包含100小时的语音、视频和相应的手工转录,视觉模态涵盖 lip-reading 信息和说话人使用的演示幻灯片。基于Chinese-LiPS,我们开发了一个简单而有效的管道,LiPS-AVSR,利用 lip-reading 和演示幻灯片信息作为视觉模态进行AVSR任务。实验表明,lip-reading 和演示幻灯片信息分别使ASR性能提升约8%和25%,综合性能提升约35%。该数据集可在 https://kiri0824.github.io/Chinese-LiPS/ 获取。
关键词
引用
@article{arxiv.2504.15066,
title = {Chinese-LiPS: A Chinese audio-visual speech recognition dataset with Lip-reading and Presentation Slides},
author = {Jinghua Zhao and Yuhang Jia and Shiyao Wang and Jiaming Zhou and Hui Wang and Yong Qin},
journal= {arXiv preprint arXiv:2504.15066},
year = {2025}
}
备注
6 pages, 7 figures