FlanEC: 探索 Flan-T5 用于 ASR 后错误校正
计算与语言
2025-01-23 v1 人工智能
声音
音频与语音处理
摘要
在本文中,我们提出了一种利用 Flan-T5 的编码器-解码器模型,用于自动语音识别(ASR)后的生成式语音错误校正(GenSEC),并将其称为 FlanEC。我们探索了其在 GenSEC 框架内的应用,通过将 n-best 假设映射为单一输出句子来增强 ASR 输出。通过利用 ASR 模型的 n-best 列表,我们旨在提高最终 ASR 转录结果的语言正确性、准确性和语法规范性。具体而言,我们研究了扩大训练数据规模并引入多样化数据集是否能显著改善 ASR 后错误校正。我们使用 HyPoradise 数据集对 FlanEC 进行了评估,对该模型在该领域的有效性提供了全面分析。此外,我们在不同设置下评估了所提出的方法,以衡量模型的可扩展性和效率,为指令微调的编码器-解码器模型在此任务中的潜力提供了有价值的见解。
引用
@article{arxiv.2501.12979,
title = {FlanEC: Exploring Flan-T5 for Post-ASR Error Correction},
author = {Moreno La Quatra and Valerio Mario Salerno and Yu Tsao and Sabato Marco Siniscalchi},
journal= {arXiv preprint arXiv:2501.12979},
year = {2025}
}
备注
Accepted at the 2024 IEEE Workshop on Spoken Language Technology (SLT) - GenSEC Challenge