面向讲座转录文本机器翻译的双语语料挖掘与多阶段微调
计算与语言
2023-11-08 v1
摘要
讲座转录文本翻译有助于学习者理解在线课程,然而构建高质量的讲座机器翻译系统缺乏公开可用的平行语料库。为此,我们考察了一种平行语料挖掘框架,其提供了一种从 Coursera 上公开可用的讲座中快速有效挖掘平行语料库的方法。为创建平行语料库,我们提出一种基于动态规划的句子对齐算法,该算法利用机器翻译句子的余弦相似度。句子对齐 F1 分数达到 96%,高于使用 BERTScore、LASER 或 sentBERT 方法。对于英日与英中讲座翻译,我们各自提取了约 50,000 行的平行语料库,并通过人工过滤创建了开发集和测试集以基准测试翻译性能。通过机器翻译实验,我们表明所挖掘的语料库与域外平行语料库结合并通过多阶段微调使用时,可提升讲座转录文本的翻译质量。此外,本研究还给出了关于语料收集与清洗、平行句挖掘、挖掘数据噪声清洗以及创建高质量评估切分的指导方针。为可复现起见,我们已发布语料库及创建它们的代码。数据集可在 https://github.com/shyyhs/CourseraParallelCorpusMining 获取。
引用
@article{arxiv.2311.03696,
title = {Bilingual Corpus Mining and Multistage Fine-Tuning for Improving Machine Translation of Lecture Transcripts},
author = {Haiyue Song and Raj Dabre and Chenhui Chu and Atsushi Fujita and Sadao Kurohashi},
journal= {arXiv preprint arXiv:2311.03696},
year = {2023}
}
备注
Submitted to the Journal of Information Processing (JIP). arXiv admin note: text overlap with arXiv:1912.11739