NAIST-SIC-Aligned:一个对齐的英日同声传译语料库
计算与语言
2024-04-02 v4
摘要
同声传译(SI)数据如何影响同声机器翻译(SiMT)仍是一个问题。由于缺少大规模训练语料,相关研究受限。本文旨在通过引入 NAIST-SIC-Aligned 填补空白,这是一个自动对齐的英日并行同声传译数据集。从非对齐语料 NAIST-SIC 出发,我们提出两阶段对齐方法使语料并行化从而适于模型训练。第一阶段为粗对齐,对源句与目标句执行多对多映射;第二阶段为细粒度对齐,通过句内与句间过滤提升对齐句对质量。为保障语料质量,各步骤均经定量或定性验证。这是文献中首个开源大规模并行 SI 数据集。我们还人工精标一小规模测试集用于评估。结果表明,使用 SI 数据训练的模型在翻译质量与延迟上较基线显著提升。我们希望本研究推动 SI 语料构建与 SiMT 研究。数据见 https://github.com/mingzi151/AHC-SI。
引用
@article{arxiv.2304.11766,
title = {NAIST-SIC-Aligned: an Aligned English-Japanese Simultaneous Interpretation Corpus},
author = {Jinming Zhao and Yuka Ko and Kosuke Doi and Ryo Fukuda and Katsuhito Sudoh and Satoshi Nakamura},
journal= {arXiv preprint arXiv:2304.11766},
year = {2024}
}
备注
LREC-Coling 2024