NeKo:基于任务引导混合专家语言模型的跨模态识别后错误纠正
计算与语言
2025-12-02 v2 人工智能
机器学习
多智能体系统
音频与语音处理
摘要
构建一个通用的识别后错误纠正器面临一个关键问题:我们如何最有效地在一个大型异构数据集混合物上训练模型?答案在于学习数据集特定的特征并在单一模型中消化其知识。先前的方法通过使用独立的纠正语言模型来实现这一点,导致参数数量显著增加。在本工作中,我们提出混合专家(MoE)作为解决方案,强调MoE远不止是一个可扩展性工具。我们提出了一种多任务纠正MoE,其中训练专家成为语音转文本、语言转文本和视觉转文本数据集的"专家",通过学习将每个数据集的标记路由到其映射的专家来实现。在Open ASR Leaderboard上的实验表明,我们探索了一种新的最先进性能,实现了平均相对5.0%的词错误率(WER)降低,以及语音和翻译任务的BLEU分数显著提升。在零样本评估中,NeKo在Hyporadise基准上优于GPT-3.5和Claude-Opus,实现了15.5%至27.6%的相对WER降低。NeKo在语法纠正和识别后OCR纠正方面作为多任务模型表现具有竞争力。
引用
@article{arxiv.2411.05945,
title = {NeKo: Cross-Modality Post-Recognition Error Correction with Tasks-Guided Mixture-of-Experts Language Model},
author = {Yen-Ting Lin and Zhehuai Chen and Piotr Zelasko and Zhen Wan and Xuesong Yang and Zih-Ching Chen and Krishna C Puvvada and Szu-Wei Fu and Ke Hu and Jun Wei Chiu and Jagadeesh Balam and Boris Ginsburg and Yu-Chiang Frank Wang and Chao-Han Huck Yang},
journal= {arXiv preprint arXiv:2411.05945},
year = {2025}
}
备注
ACL 2025 Industry Track. NeKo LMs: https://huggingface.co/nvidia/NeKo-v0-post-correction