中文

HI-TransPA:聽覺障礙者之翻譯個人助理

计算与语言 2025-11-17 v2 多媒体 声音

摘要

聽覺障礙者因語音清晰度的內在挑戰,在日常溝通中常面臨重大障礙。為此,我們將 Omni-Model 范式引入輔助技術,並提出 HI-TransPA,一款以指令驅動的音視覺個人助理。該模型融合模糊語音與唇部動態,實現翻譯與對話於單一多模態框架內的結合。為應對聽覺障礙語音的獨特發音模式以及現有模型的適應性有限問題,我們開發了一套多模態預處理與數據標註管線,該管線檢測臉部關鍵點、穩定唇部區域,並量化評估樣本品質。這些品質分數指導著一種課程學習策略:先在乾淨且高置信度的樣本上訓練,逐步納入更具挑戰性的樣本,以增強模型的魯棒性。在架構方面,我們採用了一種新型統一 3D-Resampler 以高效編碼唇部動態,這對於精確解讀至關重要。在目的構建的 HI-Dialogue 数据集上進行的實驗顯示,HI-TransPA 在字面準確性和語義忠實性方面均達到最先進的性能。我們的工作為將 Omni-Model 應用於輔助溝通技術奠定了基礎,為未來的研究提供了端到端建模框架和必要的處理工具。

关键词

引用

@article{arxiv.2511.09915,
  title  = {HI-TransPA: Hearing Impairments Translation Personal Assistant},
  author = {Zhiming Ma and Shiyu Gan and Junhao Zhao and Xianming Li and Qingyun Pan and Peidong Wang and Mingjun Pan and Yuhao Mo and Jiajie Cheng and Chengxin Chen and Zhonglun Cao and Chonghan Liu and Shi Cheng},
  journal= {arXiv preprint arXiv:2511.09915},
  year   = {2025}
}