中文

赋能聋人及半聋人群群体:利用大语言模型提升视频字幕

人工智能 2025-05-22 v2

摘要

在当今数字时代,视频内容广泛存在,作为信息、教育和娱乐的主要来源。然而,聋人及半聋人群 (DHH) 常因自动语音识别 (ASR) 系统未能提供准确可靠的字幕而面临重大挑战。本文针对提升视频字幕质量的紧迫需求,利用大语言模型 (LLM) 进行探索。我们提出了一项综合性研究,探讨了集成LLM以增强ASR生成字幕的准确性和情境感知能力的方法。我们的 methodology 包括一个新颖的管道,用于使用先进的LLM纠正ASR生成的字幕。我们明确聚焦于GPT-3.5和Llama2-13B等模型,这些模型在语言理解和生成任务中表现突出。我们引入一个代表DHH群体所面临现实挑战的数据集,用于评估我们提出的管道。我们的结果表明,LLM增强的字幕显著提升了准确性,ChatGPT-3.5的词错误率 (WER) 为9.75%,显著低于原始ASR字幕的23.07%,ChatGPT-3.5相对于原始ASR字幕的WER改进约为57.72%。

关键词

引用

@article{arxiv.2412.00342,
  title  = {Empowering the Deaf and Hard of Hearing Community: Enhancing Video Captions Using Large Language Models},
  author = {Nadeen Fathallah and Monika Bhole and Steffen Staab},
  journal= {arXiv preprint arXiv:2412.00342},
  year   = {2025}
}