UniCUE:中文视觉提示语音视频到语音生成的统一识别与生成框架
计算机视觉与模式识别
2026-03-03 v4 声音
音频与语音处理
摘要
视觉提示语音(CS)通过手势编码增强唇读,为听力受损者提供视觉音素线索以支持精确的语音感知。视觉提示语音视频到语音生成(CSV2S)任务旨在将 CS 视频转换为可理解的语音信号。大多数现有研究聚焦于视觉提示语音识别(CSR),即将视频内容转录为文本。因此,CSV2S 的常见解决方案是将 CSR 与文本到语音(TTS)系统整合。然而,该流水线依赖文本作为中间媒介,可能导致错误传播以及语音与 CS 视频动态之间的时间错位。相比之下,直接从 CS 视频生成音频语音(直接 CSV2S)往往因固有的多模态复杂性和 CS 数据的有限可用性而受到影响。为应对这些挑战,我们提出了 UniCUE,这是首个用于 CSV2S 的统一框架,可在不依赖中间文本的情况下直接从 CS 视频生成语音。UniCUE 的核心创新在于整合了一项理解任务(CSR),该任务提供细粒度的 CS 视觉-语义线索以指导语音生成。具体而言,UniCUE 包含一个姿态感知视觉处理器、一个实现精确视觉-语义映射的语义对齐池,以及一个用于在统一架构中桥接理解任务与生成任务的 VisioPhonetic 适配器。为支持该框架,我们构建了 UniCUE-HI,一个大规模的中文视觉提示语音数据集,包含来自 14 位提示者的 11,282 个视频,涵盖听力受损者和听力正常者。在该数据集上的大量实验表明,UniCUE 在多个评估指标上达到了最先进的性能。
引用
@article{arxiv.2506.04134,
title = {UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation},
author = {Jinting Wang and Shan Yang and Chenxing Li and Dong Yu and Li Liu},
journal= {arXiv preprint arXiv:2506.04134},
year = {2026}
}
备注
13 pages, 12 figures