HITSZ 基于序列到序列自动语音识别模型和 Indic 大语言模型的端到端语音翻译系统用于 IWSLT 2025 Indic Track
计算与语言
2025-07-29 v1
摘要
本文介绍了 HITSZ 为 IWSLT 2025 Indic track 提交的系统,专注于英语到印度语言和印度语言到英语的语音到文本翻译 (ST)。为了提升此低资源场景下的翻译质量,我们提出了一种端到端系统,将预训练的 Whisper 自动语音识别 (ASR) 模型与印度语言专用的大语言模型 (LLM) Krutrim 集成在一起。实验结果表明,我们的端到端系统在英语到印度语言方向获得了平均 BLEU 分数为 ,在印度语言到英语方向获得了 。此外,我们还研究了 Chain-of-Thought (CoT) 方法。尽管该方法在成功解析输出(例如在泰米尔语到英语方向上实现了 的 BLEU 提升)方面显示出显著的翻译质量提升潜力,但我们观察到确保模型始终遵循所需 CoT 输出格式存在挑战。
引用
@article{arxiv.2507.19616,
title = {HITSZ's End-To-End Speech Translation Systems Combining Sequence-to-Sequence Auto Speech Recognition Model and Indic Large Language Model for IWSLT 2025 in Indic Track},
author = {Xuchen Wei and Yangxin Wu and Yaoyin Zhang and Henglyu Liu and Kehai Chen and Xuefeng Bai and Min Zhang},
journal= {arXiv preprint arXiv:2507.19616},
year = {2025}
}
备注
7 pages, 1 figure, submitted to IWSLT 2025