中文

基于习语相似性替换的 ecVoice:视频音频文本提取与优化

声音 2024-07-16 v1 多媒体 音频与语音处理

摘要

视频音频文本提取在多媒体编辑和处理中发挥着重要作用。作为一种流行的开源工具,Whisper 在人类语音识别方面表现快速,但其识别性能依赖于计算资源,这使得在低计算内存下运行 Whisper 变得困难。我们的论文提出了一个从视频中提取人类语音并获得高质量文本生成的可行方案。生成的语音可用于视频语言翻译和翻译语音模拟。为了提高人类语音的提取和转换质量,我们提出了 ecVoice 方法,利用习语相似性计算和分析来提高音频文本提取质量。进行了相对实验以验证 ecVoice 可将习语语法纠错率平均提高到 90%。该方法简单而快速,这意味着在提高语音识别率时,该方法对消耗计算资源的负面影响较小。我们的方法和解决方案可以显著增强低计算内存下的 Whisper 识别能力。

关键词

引用

@article{arxiv.2407.09489,
  title  = {ecVoice: Audio Text Extraction and Optimization of Video Based on Idioms Similarity Replacement},
  author = {Jinwei Lin},
  journal= {arXiv preprint arXiv:2407.09489},
  year   = {2024}
}

备注

APSIPA ASC 2023