中文

从语音到字幕:评估意大利电视节目中ASR模型的效果

计算与语言 2025-12-23 v1

摘要

字幕对视频可访问性和观众参与度至关重要。基于编码器-解码器神经网络架构并在大规模数据上训练的自动语音识别(ASR)系统,已在标准基准数据集上显著减少了转录错误。然而,其在现实世界生产环境中的表现,尤其是针对非英语言内容如长篇意大利视频,仍鲜有探讨。本文 presenting for意大利某媒体公司开发专业字幕系统的案例研究。为 inform系统设计,我们在50小时的意大利电视节目数据集上评估了四种最先进ASR模型(Whisper Large v2、AssemblyAI Universal、Parakeet TDT v3 0.6b和WhisperX),对其进行基准测试,与专业人类字幕员的工作进行比较。研究结果表明,尽管当前模型无法满足媒体行业对完全自主性的准确性需求,但它们可作为显著提升人类生产力的高效工具。我们指出,人机交互(HITL)方法至关重要,并展示了支持此工作流程的生产就绪云端基础设施。

关键词

引用

@article{arxiv.2512.19161,
  title  = {From Speech to Subtitles: Evaluating ASR Models in Subtitling Italian Television Programs},
  author = {Alessandro Lucca and Francesco Pierri},
  journal= {arXiv preprint arXiv:2512.19161},
  year   = {2025}
}