基于半监督学习和大语言模型的爱沙尼亚电视字幕优化
计算与语言
2025-01-10 v1 人工智能
机器学习
音频与语音处理
摘要
本文提出了一种用于生成爱沙尼亚电视内容高质量同语言字幕的方法。我们对 Whisper 模型在人工生成的爱沙尼亚字幕数据上进行微调,并通过迭代伪标签和基于大语言模型(LLM)的后编辑进行增强。实验表明,针对无标签数据集进行伪标签化可显著提升字幕质量。我们发现,测试时采用 LLM 基于编辑可提高字幕准确率,而在训练时使用 LLM 编辑未能获得额外的提升。该方法有望接近人工水平,适用于实际应用场景。
引用
@article{arxiv.2501.05234,
title = {Optimizing Estonian TV Subtitles with Semi-supervised Learning and LLMs},
author = {Artem Fedorchenko and Tanel Alumäe},
journal= {arXiv preprint arXiv:2501.05234},
year = {2025}
}