迈向包容性通信:从手语、唇语和音频生成口语的统一框架
计算机视觉与模式识别
2026-03-25 v4 多媒体
音频与语音处理
图像与视频处理
摘要
音频是人类通信的主要模态,并推动了自动语音识别(ASR)技术的成功。然而,这种以音频为中心的系统固有地将聋人或听力障碍者排除在外。手语和唇读等视觉替代方案提供了有效的替代手段,且手语翻译(SLT)和视觉语音识别(VSR)的最新进展改善了无音频通信。然而,这些模态在很大程度上被孤立研究,它们在统一框架内的整合仍有待探索。在本文中,我们提出了首个统一框架,能够处理手语、唇部动作和音频的多种组合以生成口语文本。我们关注三个主要目标:设计一种能够有效处理异构输入的统一、模态无关架构;探索模态间未被充分研究的协同作用,特别是唇部动作作为手语理解中非手部线索的作用;实现与针对单一任务定制的SOTA模型相当或更优的性能。基于该框架,我们在SLT、VSR、ASR和视听语音识别任务上实现了与特定任务的SOTA模型相当或更优的性能。此外,我们的分析揭示了一个关键的语言学见解:将唇部动作作为独立模态进行显式建模,通过捕捉关键的非手部线索,显著提升了SLT的性能。
引用
@article{arxiv.2508.20476,
title = {Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio},
author = {Jeong Hun Yeo and Hyeongseop Rha and Sungjune Park and Junil Won and Yong Man Ro},
journal= {arXiv preprint arXiv:2508.20476},
year = {2026}
}
备注
Updated the professional title of the corresponding author. Added an Acknowledgement section