基于 DPO 微调的大语言模型用于同步语音翻译中的分段
计算与语言
2025-10-15 v1
摘要
同步语音翻译需要准确的分段以平衡翻译质量和延迟。近期研究如 SHAS 引入了预训练分段模型,相较于启发式规则取得了更好的性能。然而,虽然预训练的分段模型如 SHAS 在超越启发式方法方面更具鲁棒性,但仍受制于监督学习目标,未能融入人类偏好对齐,而后者对于自然实时解译至关重要。本文提出一种基于大语言模型(LLM)的分段框架,使用直接偏好优化(DPO)进行训练。通过利用偏好对齐,我们的方法使 LLM 能够预测更符合实时翻译需求的自然分段点。我们在 ACL 60/60 语料库上进行评估,涵盖英日、中德三种语言对,采用 SeamlessM4T v2 作为翻译底层。实验结果表明,DPO 微调的 LLM 在分段准确率上优于 SHAS,并在翻译质量(BLEU、COMET)和延迟(Average Lagging)方面持续获得改进。此外,我们的系统还从 IWSLT 数据集中受益。这些发现凸显了偏好微调 LLM 的潜力,以超越现有预训练分段模型,推动自适应、以人类为导向的同步解译。
引用
@article{arxiv.2510.12195,
title = {DPO-Tuned Large Language Models for Segmentation in Simultaneous Speech Translation},
author = {Zeyu Yang and Satoshi Nakamura},
journal= {arXiv preprint arXiv:2510.12195},
year = {2025}
}