中文

Pisets:面向讲座与访谈的鲁棒语音识别系统

计算与语言 2026-01-27 v1 声音 音频与语音处理

摘要

本工作为科学家和记者提出了一个语音转文本系统“Pisets”,该系统基于三组件架构,旨在提高语音识别准确性,同时最大限度地减少与 Whisper 模型相关的错误和幻觉。该架构包括使用 Wav2Vec2 进行初步识别、通过 Audio Spectrogram Transformer (AST) 进行误报过滤,以及通过 Whisper 进行最终语音识别。课程学习方法的实施和多样化俄语语音语料库的使用显著提高了系统的有效性。此外,引入了先进的不确定性建模技术,进一步提升了转录质量。与 WhisperX 和普通 Whisper 模型相比,所提出的方法确保了在各种声学条件下对长音频数据的鲁棒转录。“Pisets”系统的源代码已在 GitHub 公开:https://github.com/bond005/pisets。

关键词

引用

@article{arxiv.2601.18415,
  title  = {Pisets: A Robust Speech Recognition System for Lectures and Interviews},
  author = {Ivan Bondarenko and Daniil Grebenkin and Oleg Sedukhin and Mikhail Klementev and Roman Derunets and Lyudmila Budneva},
  journal= {arXiv preprint arXiv:2601.18415},
  year   = {2026}
}